{"as_of":"2026-08-18T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f7f23e416608ee3c78bdf74f9d5ec55efe54ced95e00c8808de8f56a9f7d400","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:12:19.056273Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00775/citation-record","integrity":"/paper/2606.00775/integrity","json":"/paper/2606.00775/citation-record.json","paper":"/paper/2606.00775"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Tall: Temporal activity localization via language query,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:084ae3641b52c7191d5e3679d34da5c38d727f796e0a1175b8845e0f96928141","observation_id":"f465561a-3f0c-4de7-8780-014ae0fba43b","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Localizing moments in video with natural language,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e52bd50d23cb6b060eacc430ba14cca9d9f99af2656938a15220035404957bf9","observation_id":"adb7708f-0c59-4c01-b3bd-7dc6993229dd","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Maban: Multi-agent boundary-aware network for natural language moment retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:4326aa88b0a98ee4e718d5868393c4ad97f873f38d6ffe82d6dad7313b18cbeb","observation_id":"9207add4-b91d-48ae-8b76-e1f820ac0dad","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Temporal sentence grounding in videos: A survey and future directions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:cc5cc3388d8122e371e62c05d16dad10e0995e443d306474b73f01a319adf840","observation_id":"d03f14fb-7f39-4c90-8d18-7a267646acae","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Video moment localization via deep cross-modal hashing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:d03b1a4f8cbe602c048b07b674ab6b144b2055171b2d614a68287e87fc1b1764","observation_id":"0f8d28db-12da-4d4f-8f83-944fe0b78edf","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Local correspondence network for weakly supervised temporal sentence grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:5a295c88a20faa4af089758b4ae8682ac7866049cf046c51da079ef5cbf82c71","observation_id":"9cda1038-f5b3-4e48-8fd3-e208c6d054fd","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Video moment retrieval with cross-modal neural architecture search,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b9868604ef91efdab4edc1107c8666a0e479fcd84e63b05d2eb1519793f0d72c","observation_id":"a11d3f02-1768-48b4-a96d-ed9d0da12550","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Bam-detr: Boundary-aligned moment detection transformer for temporal sentence grounding in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:8688565a94256c91098c753712b04cd24f5fd45288052e03dff7043bb6ef7309","observation_id":"00692f0b-e274-4952-8d02-a7704d90d5c3","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Bmrn: Boundary matching and refine- ment network for temporal moment localization with natural language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:d79f93dd823e966d900fcc17b3aef7183821b3af357eef5d3ca71638d2d954cc","observation_id":"453223da-0558-475d-8cc5-02b6c79a35f2","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Time-r1: Post-training large vision language model for temporal video grounding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:0f2e19a2ea88ee191528e38dc59abfdf56760c66cb9b2564cd75296901b671f2","observation_id":"8ebdf27c-d33d-49fe-8895-41903945d3de","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Datasets and recipes for video temporal grounding via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:f0b8d025a23efa759ff66c6121190d8c6ed5f48f0d59ef881db5efe25c50b3f0","observation_id":"006f70b7-f2b0-4dfe-9705-b4dd760c21ea","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Detecting moments and highlights in videos via natural language queries,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:31b8bdc0af17495d0f1edb359620a86ec01b354cd14651ed9cb0db2cafe5388a","observation_id":"5cc408cd-e345-4725-be20-c3eb4a9a25f8","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Correlation-guided calibration of query dependency for video temporal grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:23b59f054f7dc4bef1f36fd4604b4c2a6e8278b771dde34636ddec54810b0ebf","observation_id":"c58c0a7c-2a63-4808-bed8-4e58cb883788","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Tr-detr: Task-reciprocal transformer for joint moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:3aea38094f49f1ce3c4a186c535bf078d096e9872082f9d42653385b1eaf7699","observation_id":"dc839488-eeef-468f-866a-d88c6eedbbfe","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1caaf8e6af7d837fa4901e25eeaa6cca957ac31b8c8753cebd5c21bf0e17499b","observation_id":"bb899f93-7858-4d67-aed8-2e3c979edce7","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Bridging the gap: A unified video comprehension framework for moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1de856e55afed743a6713e8ef6297ff9f5c8177e25a7b959f5cb378123f8035a","observation_id":"a37b33f3-5e5d-47e5-98f8-15f089170285","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:328bce4ee1542f48eed5f4efdef26ff0b40cba6f509697b8ae8f4027d470abc2","observation_id":"1a426ad7-40c9-47e3-ae1a-3e13049c8f07","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Aligning large multimodal models with factually augmented rlhf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:3d12667a65637d2e3fbddba2ec705156c68c081ad9027635927744d9150e58bf","observation_id":"201b44d4-b361-4e0c-af74-4c814f355fea","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Video-r1: Reinforcing video reasoning in mllms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:843869101a7ec8d90a1a6e6e82d12d039e97c9bf8c6c4f5ce4abd7fc4e511b50","observation_id":"a8c9ef08-fb25-44d9-9c37-3bf43ded6860","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:83f9e8f1e9ebddc0e1c6ecba37f539e6d148f9898a30c6b97ce1aa397d09492a","observation_id":"0184536a-2922-4441-9350-5757af83f581","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Policy gradient methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:135d04b6f3dbee053db85f68e12a7e243e8ca59ac72ffb24ae6e28eebe446e01","observation_id":"3db00ca2-cdcf-4dee-9630-d3a37986e2ad","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Overcoming catastrophic forgetting in neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:5ac83349abc73577981e8b18e18409d719065f38e87cfcd82284aa71ee8de88a","observation_id":"c9d9d3c1-7dde-4766-a391-275d8254cec4","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning without forgetting,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:6390abf94de86104bc7256116bd0cd77d0a0b114da41057f27a5112346e14b54","observation_id":"7fc4dafe-d46f-4630-bb1e-484bc4445d80","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Context-aware biaffine localizing network for temporal sentence grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:7cbfef087df2bfd9879ab6f526b27a81cdb047c3fe6928d7ba6d39a2416024c4","observation_id":"9e5d3736-bc3b-43eb-8a49-2f1e26f0e726","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Grounding action descriptions in videos,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:08ef5ba9b818011563b171f921101d2ddf8876e35a1df9d1a0a2d3bf2615e737","observation_id":"3684139f-948d-41d6-9697-5143d222b4ba","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"To find where you talk: Temporal sentence localization in video with attention based location regression,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1e3a8b9c31cfd9f6fcd002725f24ecb414e7b02e5891c8bdfd4e76722c493304","observation_id":"6682f9d4-1ed7-4bad-9a59-878e5584cc97","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:8f74a42fd6f23ed53d8b37e801fe3aa56dfff2c037f7ee8aa454706b9dd6c519","observation_id":"b61d8a34-f5ac-40cd-b44d-afb9f2db4362","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Span-based localizing network for natural language video localization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:bfcd812128dc33781c5d1f0ef13c8f885b9dae866a5f9bf934f395cb2edd13c9","observation_id":"ec916a8b-ffee-4b1c-956b-f5ad3f572b89","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Dense regression network for video grounding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:841b4dc06c65d3e51aff8c28270bb84b59a7cc0023790db092143c4b116e5f41","observation_id":"86a52aee-ad75-455d-a681-013538e03313","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning modality interaction for temporal sentence localization and event captioning in videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:d9275a1f048f8361fce1dd26a4ab49a7569615c9abb4e4b2dbf4cc0369c7ef0d","observation_id":"ba45f08c-cf44-4eea-bc31-85ffb724b179","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Multi-modal interaction graph convolutional network for temporal language localization in videos,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b90670efd7e46ebf1a35f41219552b4e56f4f581d3fe17c4d672d1b3c7cf5d92","observation_id":"fb659fde-1eda-4f95-b56f-cb7c7106a045","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"On pursuit of designing multi-modal transformer for video grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:9aa0f8ad9cace2ff30d9a6b32e30106dc0003ad436f2fd744377aa9c8bdb2e26","observation_id":"0eeca70a-c714-4b6c-9483-6069e8467ad7","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Query-dependent video representation for moment retrieval and highlight detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:384a196e3750a5f5f26e5272afa1b372e45c5682a8dd7a8bd7401e5a93f027ba","observation_id":"fd14af81-937a-44f1-b8b0-166f25daa0b0","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Knowing where to focus: Event-aware transformer for video grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:3a6abdbd2dfd62690f8b5215b273f41a47c8f19c37310e022b9bd637cc617a20","observation_id":"24c0deb2-a9fd-4422-bc92-88c807a1da80","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:a7067108d3fa43eecd3290d3207e187492a43746225bd5fd5bba602d01d7dcd4","observation_id":"2513675f-6a24-49a8-aeca-62d4b3bb630e","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning to summarize with human feedback,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:922fd47d25b4a5bbaae229295ad4fd5dd254dac21561600fcdc702f220c9fe23","observation_id":"7ef15008-48f1-42c8-97eb-303901602b8d","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:16b69ef60382f9eedf134dde07908a9e2abfefd1c91c7382e4809e9b7b15d2f2","observation_id":"2801eba7-0c26-49e2-8957-72a1a26ce822","resolution":{"observed_at":"2026-06-28T19:12:34.383083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ae97f2f149197c52f518f706804c87d538af25579dd9afc2b11a8444b451e166","observation_id":"d39c71fe-148d-4576-81aa-6a2fb36aec8f","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:2e6fa5644c25429a00df0a0ba99955d98eea2f35353eaf99ab944565b6998794","observation_id":"7c1c6eef-3d01-468e-8481-9f226925db52","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:fd10a9a8a45c3e0eccacef732f52610c28bb68aedc091399b7208455adfe06c3","observation_id":"0c73b767-4bf4-4697-a6ca-f382dceef4c6","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e14c83bfd147f3585bedf12dbde0d364248a83d0078c13d1f95da1fae124a479","observation_id":"d60dd2ad-e7ff-4ebe-afb1-50cd8d4fc5ec","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Active object localization with deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:c75139a37345301e36c306df99d298103fa845e11f6db141fa91e24833f6a91b","observation_id":"d83a4d7a-4d5a-489c-9221-9eab4127507f","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Read, watch, and move: Reinforcement learning for temporally grounding natural language descriptions in videos,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1523aab18858e63c77a3bb2e7a70bead52400c808dc2ac3e1bb3e61c8357d056","observation_id":"c3e5670a-7f83-4477-bc87-fdb1c648aa28","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Tree-structured policy based pro- gressive reinforcement learning for temporally language grounding in video,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:dfdf86523c062da524beefb9953b0285f13f31744c9465903d247d1d63b60b93","observation_id":"449bec6f-39d1-479f-90d7-dcc00382c64a","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:ea7146d51c59022a4734bdd0b6b124a12b9069ba27990baab7178fd5e24d28fb","observation_id":"137feabc-ba8d-4ec2-a3c9-050b292f38ca","resolution":{"observed_at":"2026-06-28T19:12:34.385538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Spatiotem- poral contrastive modeling for video moment retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b1040022f07b2349f9a56c813aeadda2dc5366c8bc3a7bfad0d8b979893c5f70","observation_id":"73024ba5-a11e-401d-984c-72ee9a38c0ce","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Momentdiff: Generative video moment retrieval from random to real,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:f5b4c62977a43fe473d7ae1ea0e0f141ceeb220b77f51d02c754d591483ee4bd","observation_id":"ad8848c8-8f28-4570-8028-ad369c1cb4ea","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Univtg: Towards unified video-language temporal grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:b1689ebba66db5e5989c83d58a958ea33bce204efacfb92324c68d34fb52b7e4","observation_id":"f8e0d7d0-0acc-4014-bb28-0e46658e8eeb","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Prior knowledge integration via llm encoding and pseudo event regulation for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:c854d5014534f94b5e12220d0b7d937189726eca9de2b5231856dacc00f23fcc","observation_id":"60a38052-4342-4885-82c1-7ae9e16d2d7d","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Diversifying query: Region-guided transformer for temporal sentence grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:3be5094adbf38909e87762a890cef9bfad4ab09aad299926499ddaaf4878c551","observation_id":"b77e124e-8c3e-47e7-8f7c-ed0116cb1009","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Maskable retentive network for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:6da444d3181eccfc1ad6b90c401b8b0b8281e60389f4cf7211f265cbc3534532","observation_id":"458bbce4-6293-4644-ac60-5f64d1ec4807","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Sa-detr: Span aware detection transformer for moment retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:1ef7b5987c3727528d27d1c2401ed8d61aad31544b228b0925e13528a5c809e0","observation_id":"1b606574-bba6-40b9-8741-c5f99637a894","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Query-aware video encoder for video moment retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:fec01feb020a93cd4ef22098a9b256011b020d9df01f2c4ffa2282f70a84b316","observation_id":"6711d2ec-ffc9-4188-ad23-000e5fd93088","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:d966571e45c4e61878ba047e43d225acfd946700165b8d25a329bdbdc9bd9fb4","observation_id":"e076bb6d-c027-4484-b204-8eabf96d5909","resolution":{"observed_at":"2026-06-28T19:12:34.378295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:e9629c9dbf1a34fd73cea9a6fe4c2e6e3aa48b423a6f7371325f95ac2de210ec","observation_id":"e03efa0a-cf11-4f15-b940-6938ba129be0","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:5249810aad8b0bac308586af5a887e4a031ca57a295286c1e5da1942d8af470b","observation_id":"8d9d6d38-27b7-420a-84ea-c7b2da6d5d18","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-16T20:34:09.579602Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":"2403.15377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-07-04T06:39:37.518508Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":"1f0f626c-f5dc-428e-9eb7-3e99516c1cc5","year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:4c94cf1b9cecedaf8dd239f656b8428fcc302e52a7881049b108305a1cb8649d","observation_id":"825cb563-f5c1-4de2-8225-143668a3cd13","resolution":{"observed_at":"2026-06-28T19:12:34.375723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:19.056273Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:92b0b4e0c5eb27c51e0b37c590b0611d886a950a3d55dca36539327eaef36f19","observation_id":"bb0cac3c-f812-47f2-8461-ed2a6f99ab48","resolution":{"observed_at":"2026-06-28T19:12:19.056273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.01558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:12:34.379353Z","title":"Video- lights: Feature refinement and cross-task alignment transformer for joint video highlight detection and moment retrieval,","venue":null,"work_id":"1d7f0c3c-9e5a-4d5f-81e9-e364f247aa76","year":2024},"citing_paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T19:12:19.056273Z"},"links":{"citing_paper":"/paper/2606.00775"},"observation_digest":"sha256:87ffdd2eade41d2143d82e7fefe44aa9aa0116c68f83d1970d52dd7895bfd108","observation_id":"1650114f-a48e-4d78-8233-857bcf70c9e6","resolution":{"observed_at":"2026-06-28T19:12:34.380827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.00775","last_updated":"2026-05-30T15:40:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T13:55:33.018137Z","submitted_at":"2026-05-30T15:40:00Z","title":"GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2606.00775."}