{"as_of":"2026-08-06T22:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5725a569f26148f5f42b7380fa3da6e160d389290e750ced71625261511a7b4a","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T02:18:21.718091Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:17:27.916261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03963","snapshot_observed_at":"2026-08-03T04:17:27.916261Z","title":"Tempr1: Improving temporal understanding of mllms via temporal-aware multi-task reinforcement learning.arXiv preprint arXiv:2512.03963, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-06T22:44:46.528771Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.916261Z"},"links":{"cited_paper":"/paper/2512.03963","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:4e0483c93d5b6040cc8d0d0123406105f611e0f10bad9f4a9a243f81cd4e6e28","observation_id":"38fb59fc-0b9b-4067-9d2c-c447183f7ddc","resolution":{"observed_at":"2026-08-03T04:17:27.916261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03963","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Tempr1: Improving temporal understanding of mllms via temporal-aware multi-task reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-06T08:59:01.715141Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2512.03963","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:256c76515bd62a4aa1c7f2f74565d82363c2c2e14ac7442c136fee0ee13f365c","observation_id":"ce54db9b-5438-4540-9a1b-cbffd719bea6","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03963","snapshot_observed_at":"2026-08-01T18:04:16.823032Z","title":"Tempr1: Improving temporal understanding of mllms via temporal-aware multi-task reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.823032Z"},"links":{"cited_paper":"/paper/2512.03963","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:b7d4f7f107eb94d03ec27f2f5fcfb5458236a195ca4a56676a9b4396550ae8a1","observation_id":"31e83b57-04d5-45c2-93b1-b4bffa41c296","resolution":{"observed_at":"2026-08-01T18:04:16.823032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.03963/citation-record","integrity":"/paper/2512.03963/integrity","json":"/paper/2512.03963/citation-record.json","paper":"/paper/2512.03963"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:853a8be05eca42ef1019c95c8422e49fcee279f0ef5657ee35e693240a261c63","observation_id":"9e924d67-296f-4bc0-97c4-95c6e387773f","resolution":{"observed_at":"2026-05-17T02:18:52.240459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"be1de685-5a99-4056-880f-d2c18061f834","year":2017},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:78a39f4e00086af01c465fc129ad503ce538570eba677cb89dd73aa91ec7ac85","observation_id":"ca102fe4-0294-4bc1-9fbe-3246bf0dcebe","resolution":{"observed_at":"2026-05-17T02:18:52.929711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:6014e825063183f1f00187945802253e121e071d0b02b524f5cdc33e50420a08","observation_id":"c2da755f-03bf-48c4-8594-4bb41a80e636","resolution":{"observed_at":"2026-05-17T02:18:52.236564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-06T03:54:12.027415Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14231","doi":"10.48550/arxiv.2505.14231","metadata_source":"pith","pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Univg- r1: Reasoning guided universal visual grounding with re- inforcement learning.arXiv preprint arXiv:2505.14231","venue":"cs.CV","work_id":"fad4943c-f29d-4daa-a7ba-dd6f03aac5aa","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:592ba033ce961b39db83fadd9ce7aec22b7ce4909e492b99f223f9f10a981b6e","observation_id":"2d14289e-c51c-4387-99ec-71096cad233b","resolution":{"observed_at":"2026-05-17T02:18:52.266369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense events grounding in video","venue":null,"work_id":"9a024efb-5c90-4230-a68b-af141dc2d5d6","year":2021},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:f222ee71a4f69a41cef4dbfc9002df2916fa4b41ca7f1fb7a47d96ceb34c55ea","observation_id":"23aaa48a-bfdf-4790-98c1-42b278245487","resolution":{"observed_at":"2026-05-17T02:18:52.927612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"f8b22217-76cb-46ef-abc5-8be8ac599d03","year":2015},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:fc1c44209f5363e1a2cd470a9c571dc5bffbca869971d3686f0e98f11239bb70","observation_id":"c6fec625-18a3-4d76-9307-8443d9984044","resolution":{"observed_at":"2026-05-17T02:18:52.925448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashvtg: Feature layering and adaptive score handling network for video temporal grounding","venue":null,"work_id":"cf5eeb2d-a3af-49c8-9254-2b59762c744d","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:10e4f7eac2cb615ecd4587644b1c7dfb9637d3ff6f8a6b322589618fc8e9b410","observation_id":"6a65651b-f8ad-4a84-80c0-e377032b98ea","resolution":{"observed_at":"2026-05-17T02:18:52.923441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.111453Z","title":"Scaling rl to long videos","venue":null,"work_id":"51d8c593-7e1f-4b0e-a674-da3e22e07f8f","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:ded3fe7948d4eaf22120a7e4237f65766479988f789edb85f42f87b770756767","observation_id":"cd5c16b1-0bb6-4f72-b4ca-8e53382e30c7","resolution":{"observed_at":"2026-05-17T02:18:52.378019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07523","last_updated":"2025-04-01T04:23:59Z","snapshot_observed_at":"2026-07-06T20:50:00.422560Z","submitted_at":"2025-03-10T16:49:35Z","title":"VisRL: Intention-Driven Visual Perception via Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2503.07523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07523","snapshot_observed_at":"2026-07-04T15:09:54.931811Z","title":"Visrl: Intention-driven visual perception via reinforced reasoning","venue":null,"work_id":"5e295e70-d8e8-4932-8908-266167a5615d","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.07523","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:594c3510ca4424201d249302f5a86a54c43318fa0f32426f88a35b5ea2d2e3f5","observation_id":"42e182a2-3342-41fe-9686-0d1cf0474f6d","resolution":{"observed_at":"2026-05-17T02:18:52.374154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:e8b1ce625b2f46615e3cc0f27174fe2716d375e4d0b014ce5158b7aa6189c7a6","observation_id":"1b69e8a0-90a9-4dce-8cd0-419b334bec29","resolution":{"observed_at":"2026-05-17T02:18:52.279116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"f2bd3e0f-47fe-46e4-9c94-19560ae729f0","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:5e89ccc1abecac5dd623472b15654e3094de018f1103925e39f1ae1b15bed99e","observation_id":"ebccfd11-141e-4040-af8c-0d4fabdf6973","resolution":{"observed_at":"2026-05-17T02:18:52.921377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"5611f4ef-901a-40dd-a963-8e87ecca79c8","year":2017},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:d78f1820410e1fe1745f89ad4c9bade0c9fccd2fae8a97e99478e8b218a308b0","observation_id":"68b7ba79-714e-4aeb-92c4-ee1a6901d77f","resolution":{"observed_at":"2026-05-17T02:18:52.919212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-06T21:12:13.753696Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":"2508.07683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07683","snapshot_observed_at":"2026-07-02T17:27:14.974912Z","title":"Tar-tvg: Enhancing vlms with timestamp anchor-constrained reasoning for temporal video grounding","venue":"cs.CV","work_id":"8392709e-ece1-4e93-a81c-3f6b3b4a5fc6","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2508.07683","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:279dca2175c4342e1f8c3097c3492e2bf9f9132c94b3349312d853b6df44f4f8","observation_id":"ecea151b-2de8-4a09-91a9-e993788542b7","resolution":{"observed_at":"2026-06-30T03:17:07.011358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:3fb0fc69f23d02f2b40a0fd7adce9f5be067aaebf6245012d5f41208d84fe107","observation_id":"520d7b46-2d7f-4254-a6a2-34761e1c5191","resolution":{"observed_at":"2026-05-17T02:18:52.257349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-01T19:33:10.793870Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":"2410.05643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-07-02T12:16:57.678370Z","title":"Trace: Temporal grounding video llm via causal event modeling","venue":null,"work_id":"b2af5095-2950-48b5-af5e-270218b8d041","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:173ffe63641b57f236a997e2ad331628839bf05ce1b35527a3c000afd35b7465","observation_id":"169e689b-ea81-47b2-ae35-2c795d170f3c","resolution":{"observed_at":"2026-05-17T02:18:52.385855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"4423f309-5aba-4cd3-a637-18a7e706d62d","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:a53a68d93febe4ac8710be7299ad34e6eed31c35f84c73a6f213b9180d240214","observation_id":"c545c391-4de8-4bf9-9af6-5814e52614dd","resolution":{"observed_at":"2026-05-17T02:18:52.917145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:8ec63248c284cabfe5f1890504d69f33679d3698003c749e1ec2321c020be71e","observation_id":"a01b7b66-7d29-4ad0-94ec-e21dfb402f7b","resolution":{"observed_at":"2026-05-17T02:18:52.289328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-05T06:26:04.370247Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"cited_work":{"arxiv_id":"2501.00584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00584","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online Video Under- standing: A Comprehensive Benchmark and Memory- Augmented Method","venue":null,"work_id":"dfb93eca-d643-48fe-befe-016a665764e2","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2501.00584","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:2e043d6f8f957e09af309bbb341c6dc1a1da50f480d86176530d3472c65d187b","observation_id":"9807d542-83f1-4aec-9b6c-a81ac8618563","resolution":{"observed_at":"2026-05-17T02:18:52.274928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"in the wild","venue":null,"work_id":"a2842983-17d1-4fd3-8ed6-b863338644af","year":2017},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:ef4f63c47271f5c1e10da91605f4478bac93546e44a651c8198883fb3bccbb92","observation_id":"4623874d-a6f0-4582-b3d5-c36b164e0407","resolution":{"observed_at":"2026-05-17T02:18:52.914937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:f8b229173bf9aeb0d1e9d341c693ac03f6bccf2664372457eaf7b4e0043a2f6c","observation_id":"f2974a46-ed9a-4530-a305-09ee1de41461","resolution":{"observed_at":"2026-05-17T02:18:52.365201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowing where to focus: Event-aware transformer for video grounding","venue":null,"work_id":"61782e0c-7424-4905-987e-dd51f85a0aa3","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:6b0cd959f24ac1d23eac4b4231a60cb04e18e189381cbcd4fb2dafc610eca7fd","observation_id":"a1bfd47c-1aea-4da4-a8d9-9ffb80f8ef83","resolution":{"observed_at":"2026-05-17T02:18:52.912742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"55943778-5829-445f-83ec-367191905d6c","year":2017},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:41410347fac32d73ef9d793d3ba2ad4d0f264db64a80b33426cf9526bef40f01","observation_id":"de5e88f1-43a6-4c72-9611-8fbe04d39583","resolution":{"observed_at":"2026-05-17T02:18:52.910580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"b9495ac0-671e-49f1-840c-8815a204150b","year":2021},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:aa3e1a3a9b2da1410c4c3d1b5b47ba3e539ae655f828623264197bb5fc92a876","observation_id":"6c2f1939-f828-48b5-941a-67ca5bde11a3","resolution":{"observed_at":"2026-05-17T02:18:52.907868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:c51f96c49d2a7312c506663b1feeddf379de055e60bed59658b58f2ca6f01d2f","observation_id":"c12dd039-c2f9-4ce8-818e-28bf6ffea39e","resolution":{"observed_at":"2026-05-17T02:18:52.294965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"7af9fff5-ce00-49ad-b41e-5b1209f581a2","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:d63ddd90e9af286d4b883dd0598f903e861e235e08900cb1155ed1b3ae5b6b2f","observation_id":"b52f970c-bf0a-4400-9c52-e9db42d95dfe","resolution":{"observed_at":"2026-05-17T02:18:52.905506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mo- mentdiff: Generative video moment retrieval from random to real.Advances in neural information processing systems, 36:65948–65966","venue":null,"work_id":"dd555c37-21dd-485e-9593-63efd924c88f","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:0b802025cb2d6caf19145c71d6a9ea4cc5ea4a58374240d5a60a7d604ec9f294","observation_id":"01f84cc9-2158-465c-85cd-b87dd00ccf88","resolution":{"observed_at":"2026-05-17T02:18:52.902868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:5e9fe5d11ed61a01d0b122d63afe1e09bf6d71e0892179e0125e729409188842","observation_id":"272ecf85-534d-471f-9d58-5b4347c00ece","resolution":{"observed_at":"2026-05-17T02:18:52.299074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ground- inggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":"b1b40f0a-e6db-44b6-8f8e-6d96039d27e6","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:5b937f9fbd118512d1357959514d4895fee1e9c8eac08ad17aedfe729565ddf3","observation_id":"93ac2896-e900-4888-a00a-4a25f5a5458d","resolution":{"observed_at":"2026-05-17T02:18:52.900629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llava: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":"27530b1d-aeba-46fa-93ae-b9c6b2075f28","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:605bfd0ad6812b48e00f69dcbddc28ac33a6463276b8f02d7b9d61f8901ddf2b","observation_id":"d7c17fae-3323-4fa8-bc27-438b4c46233a","resolution":{"observed_at":"2026-05-17T02:18:52.841392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"1b79c920-d035-41ea-a56f-9903cc8bb631","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:5e633b4c6ba0c7fc66ae517093ac527295c0ada792f6275ee4702f91bb8f2a1e","observation_id":"e56712fc-fcc8-4a34-96fa-f3204fd3b467","resolution":{"observed_at":"2026-05-17T02:18:52.898220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"b34ac6c1-7820-4e96-a2de-5ca62e2f1cc7","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:e266162e836885a7c8845731f75e7026589b33a821ce3558058e26a3244a941b","observation_id":"681f3c37-9bc1-4d10-bcc4-050b33aa5877","resolution":{"observed_at":"2026-05-17T02:18:52.896063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"9d35722e-1398-4b52-986c-c4e2ce373791","year":2022},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:e4de657e3d8ad85a3a6637ca64570af8bcc5d83bd9c333c0e870b17a2aceb463","observation_id":"b8c9c9b0-1b9b-45fe-920c-371565cd023a","resolution":{"observed_at":"2026-05-17T02:18:52.893610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"r 2-tuning: Ef- ficient image-to-video transfer learning for video temporal grounding","venue":null,"work_id":"928eb731-41f3-431e-8d9f-469086c20fb8","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:e8aeba6bc5131e52af1fa2a6524abe3183b10f84448b183cdb177f63899f47fe","observation_id":"672cd8b6-56a2-4a32-a61b-78fd726cba21","resolution":{"observed_at":"2026-05-17T02:18:52.890767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":"2403.00476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-07-04T10:29:44.911015Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","venue":"cs.CV","work_id":"88f4d72e-ee93-420a-a61e-64b02b8cc454","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:cf0250507627372b249b2f6d0689b9c1007df471b490c7fa5c47b7d8673c7338","observation_id":"28b801d3-bcaa-4514-b818-0c7cdf0e3eab","resolution":{"observed_at":"2026-05-17T02:46:17.144047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5166533b-559b-4d14-a512-0322de97bc33","year":null},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:5bc49c38daf49611839118609a76c455ffdd9cab19ed5256f58bdd2239174118","observation_id":"442ec364-5fa3-4d06-918a-45a016735ab8","resolution":{"observed_at":"2026-05-17T02:18:52.888371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:8f2cfe97846ec78a527a10e371c205eb937168b22d7520e6feb1a6dd984217c1","observation_id":"4f370744-bb59-4f16-9eb1-72d9333d5167","resolution":{"observed_at":"2026-05-17T02:18:52.360675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"cited_work":{"arxiv_id":"2505.20715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20715","snapshot_observed_at":"2026-07-02T17:27:15.832913Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","venue":"cs.CV","work_id":"35af37e5-9956-4ce9-be10-932e2342d463","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2505.20715","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:9d30587675751fad167b4401194a08740df412a77c1acd07a8b80be6903a231a","observation_id":"a810bf84-4b8e-4662-a534-5e19cae1e3c7","resolution":{"observed_at":"2026-05-17T02:18:52.382073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding.CoRR","venue":null,"work_id":"1444fffa-c2f7-4a0a-bf78-9f630be62f71","year":null},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:9db31673875e6cbc5af5b1c2b7dac3780ab12484ccc1ae90dac5d544f0844cdd","observation_id":"ce32cea4-58d5-429f-acab-add86dd88f39","resolution":{"observed_at":"2026-05-17T02:18:52.885789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"e485fd43-90e8-455a-99b4-8dcbfa4c2ac4","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:f26fbb39906afd2aacd92a262c2a81be22ff34fd7ba4fedcc760124906a6bde3","observation_id":"a2f9eeaa-84bd-46d6-ac96-24c143f27db4","resolution":{"observed_at":"2026-05-17T02:18:52.883621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":"2504.01805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-07-05T11:41:02.483857Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","venue":"cs.CV","work_id":"df3c8f70-c0d0-469a-b74b-b32ceb50d29d","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:9374455e402645942a978f42040b0fe6ad58c5095c522979a344bc934e421c45","observation_id":"9dc16043-078a-4a3c-8d20-3d1239b663b5","resolution":{"observed_at":"2026-05-17T02:18:52.244560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Sys- tems, 36:42748–42761","venue":null,"work_id":"708d4d14-54bd-40e8-9a4b-2a67bfd089fa","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:035cec66aa651376b497db5c27387e088296a7f4e79a28b384d2bcb7e0c7fe39","observation_id":"1a5daa42-d2f4-4fb3-af9d-0cf2f6326335","resolution":{"observed_at":"2026-05-17T02:18:52.881302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"8a076a1a-f8f4-4e7b-a321-f54d7bc3df6d","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:d27b77da2dc80f7b2e744121d1b0207cee51fd67a908f3564688c56d1eea1879","observation_id":"11d2dfa6-32f8-47de-a608-34136f45a500","resolution":{"observed_at":"2026-05-17T02:18:52.878949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:06:20.313807Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"ee6b8956-3ac5-4cbe-9ab5-9c2078e5a407","year":2021},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:2c43f6fa85039112351d2f9b0958382b86b57b207ef10d8b74ed8aa4de7b4313","observation_id":"59f2e683-7596-40d4-8c8c-769b76484e69","resolution":{"observed_at":"2026-05-17T02:18:52.876556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"f56b7d25-8cfc-4140-a204-d33837562b10","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:476b440d0c49b9020beb366e785968dba69340a0fb039e724aa5e7eb4e26a567","observation_id":"6dbe3818-759c-4abe-ae7f-eb186a401164","resolution":{"observed_at":"2026-05-17T02:18:52.873515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:e9edb4dabf4922f8a0e38477c057dd700c426cdb2ba21615c33123d2a3cdd838","observation_id":"4f603076-e551-4285-867f-d759b3d35f27","resolution":{"observed_at":"2026-05-17T02:18:52.248653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:dc77a50794d706a7f6b0d9be1b5f13d0cc9d44963d34ff5be016363bae58a962","observation_id":"6d828343-faca-4796-998e-a3172586f1a0","resolution":{"observed_at":"2026-05-17T02:18:52.253010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end dense video grounding via parallel regression.Computer Vi- sion and Image Understanding, 242:103980","venue":null,"work_id":"52efe0b7-405a-4015-a29c-2070bb1e7da6","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:9aa9b0228355f4adfa504c60ff9d5ae708091943ff55ca80007b932ae33fe6f1","observation_id":"e4818a9e-30d2-4592-9db8-3dd509e5649c","resolution":{"observed_at":"2026-05-17T02:18:52.870909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:00:11.687648Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"7c0ae08e-b184-4ff8-820d-9f6682eb176e","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:49ece88654a78c50072fdfd1f28b4c0c731b08c8858da7afd90590d097100385","observation_id":"1459d225-e80c-4a46-bab7-4e39c11f7548","resolution":{"observed_at":"2026-05-17T02:18:52.868466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tr- detr: Task-reciprocal transformer for joint moment retrieval and highlight detection","venue":null,"work_id":"b17ba163-9583-4ebf-aee2-be234d4f942e","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:c4f452bb56225f70442d139a2a064399f6fafb40fb2398151824d488f087ecd7","observation_id":"7e7cee7c-7670-4ba0-9e21-e339cd5aec3f","resolution":{"observed_at":"2026-05-17T02:18:52.865957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical semantic correspondence net- works for video paragraph grounding","venue":null,"work_id":"09918ca6-a61b-432e-8b19-9c661414f783","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:1e966153d2425fd325f5235811e214af3b090d530fcd9b516063b2de769ff329","observation_id":"f233cbca-53fe-4135-bf8b-a2ad4156c04e","resolution":{"observed_at":"2026-05-17T02:18:52.863440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical semantic correspondence net- works for video paragraph grounding","venue":null,"work_id":"3f5ee0fc-e818-471e-b104-9abd5ca61cb0","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:2f2f31b0b88e15768c4e8ae30216aae75485615d8750be9b412e4d9fd9ad2a19","observation_id":"15dd6e88-c57e-4c4c-837a-008464009a0f","resolution":{"observed_at":"2026-05-17T02:18:52.860479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:35:04.377551Z","title":"Tspo: Temporal sampling policy optimization for long- form video language understanding","venue":null,"work_id":"24a9633b-7d68-45a6-b16a-68a6d2994ac5","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:897c573be588a64819093dc08fa088bae759708f9f91c1112cf7b8ecdfc9ef23","observation_id":"dc84d14d-1295-446c-b300-38fb62d65e0f","resolution":{"observed_at":"2026-05-17T02:18:52.356084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:6e632b773b7984c6770f8463b29071a6b6ff46d3ae1746cd99640026364499e7","observation_id":"862cdbb2-b580-43cb-b6df-242a8ec5a795","resolution":{"observed_at":"2026-05-17T02:18:52.302760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.905697Z","title":"Videorft: Incentivizing video reasoning capability in mllms via reinforced fine-tuning","venue":null,"work_id":"89c249fe-60da-4724-bb0c-770442676a88","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:e9aee1a05b1d11e6ec27b453e0b607d90cb683af4772931dcf8298ce7d42ffe0","observation_id":"c6333379-37db-4fd4-85b4-7502732d183e","resolution":{"observed_at":"2026-05-17T02:18:52.351204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:ed178a38e5eb605c593b43b36ea1287a37d3f74fe91f6310404e09f5253ed0b8","observation_id":"a8c5d2f2-9c0e-49b3-b0e0-b42e0379d4fd","resolution":{"observed_at":"2026-05-17T02:18:52.306944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"22756bf9-4860-4374-814b-087d5754b364","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:d94055bc9674cbbc3174a933a4267bf7b7d92ca9a89cf1bb2feedeaf3755eb65","observation_id":"f8404e5c-5d49-4305-b484-126752c65f39","resolution":{"observed_at":"2026-05-17T02:18:52.857516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-07-06T17:45:11.343569Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":"2403.10228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-07-03T20:38:56.195732Z","title":"arXiv preprint arXiv:2403.10228 , year=","venue":null,"work_id":"fb2ec1aa-a3b0-43e2-9e93-2b73d3097074","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:ef68af01eeefb4a91e41e863fc24c8da2ed6bf66aabff98f1fd4b3914ea33548","observation_id":"c2633b38-8492-4fae-b0b6-62c18d264932","resolution":{"observed_at":"2026-05-17T02:18:52.343793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16050","last_updated":"2024-10-03T09:24:56Z","snapshot_observed_at":"2026-08-05T03:05:38.218384Z","submitted_at":"2024-02-25T10:27:46Z","title":"Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge","version":2},"cited_work":{"arxiv_id":"2402.16050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effi- cient temporal extrapolation of multimodal large language models with temporal grounding bridge","venue":null,"work_id":"25f60ecf-1b9b-49e6-939a-bb9c4e0e3977","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2402.16050","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:9f0fb8b0e436fb354c3684d48cc72b84396522ca515efbe38e2274417cf8ffed","observation_id":"5de38293-abb8-4a48-8d1d-41bbe9413f47","resolution":{"observed_at":"2026-05-17T02:18:52.339400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:420a834656cecfaee396a3dfec486e021cc1940c74f8fa77003e68c3b2134438","observation_id":"fb327704-a237-408e-84ee-7a14cf52e717","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:14:31.670525Z","title":"Visionary-r1: Mitigating shortcuts in visual reasoning with reinforcement learning","venue":null,"work_id":"c227c7de-f573-4665-b921-30284b6bdb9a","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:26e1682eca57b93f4282a79f1e46bf9886e74dc2b9c03b442cef684e29b21c7c","observation_id":"1a187403-cbb5-4c2f-8eba-367d2645778b","resolution":{"observed_at":"2026-05-17T02:18:52.284171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"d5ed09db-786c-4c64-ba54-2b463f52424f","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:b8c05b64c36b6f583f71fd42dbc5348c39aa1fc9ae9155a84ad3980856504b0b","observation_id":"6a123d00-0d84-4dba-92cd-0ef2c475cd52","resolution":{"observed_at":"2026-05-17T02:18:52.854622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging the gap: A unified video comprehension framework for mo- ment retrieval and highlight detection","venue":null,"work_id":"1d7b4566-8350-4784-a158-e0c41d6154c7","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:bea6aac4dcc57de6794427827dd0314e2fc9a489415ad7313e186fe737c11592","observation_id":"1b539996-056c-4907-9e4c-50a5e54ba3c3","resolution":{"observed_at":"2026-05-17T02:18:52.851888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":"2109.14084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-07-04T06:39:37.380967Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"509d3b12-48dd-4984-9d28-a28d917f0b1c","year":2021},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:17180dd1f74966cc5b694b30567255c30c0367a78670275257bde61036ddf69c","observation_id":"a30d6193-0b77-4a33-8a28-fdcf02fa13f9","resolution":{"observed_at":"2026-05-17T02:18:52.335434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.889311Z","title":"Videochat-r1","venue":null,"work_id":"8d2957eb-c24e-46b9-8bef-c978f7c5f0e6","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:aa80b2e24d018a1ededcda91ba4a645301c090ae9c7dbc8000a9447de0886942","observation_id":"dbb608f1-cb63-4ed3-ad90-f84c4bacb0c0","resolution":{"observed_at":"2026-05-17T02:18:52.314177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:b7f2beca1ddcdefafed174267c62b57b9a3d27d730b922aab2f600af7e68a6a1","observation_id":"067c528d-c020-458e-8a3a-3237b3e1d735","resolution":{"observed_at":"2026-05-17T02:18:52.328163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19702","last_updated":"2025-02-12T16:47:30Z","snapshot_observed_at":"2026-08-06T08:21:30.398010Z","submitted_at":"2024-10-25T17:19:55Z","title":"TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning","version":2},"cited_work":{"arxiv_id":"2410.19702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.19702","snapshot_observed_at":"2026-07-02T12:16:57.715387Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":"f2ca8961-3931-4220-a78a-7f084312f7b0","year":2024},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2410.19702","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:53dfe4330b588939e128058aa0a63fdae90b818926a217ba6ff7bdf0d7506ede","observation_id":"e0fb155f-e300-4ee5-a867-e80b8a875f35","resolution":{"observed_at":"2026-05-17T02:18:52.310729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:d3f0f6eb4426f41c215cb89220fc59117306fcc39839a597767bab20a8226ce1","observation_id":"3b27a866-be10-47e8-90f6-c954341edf38","resolution":{"observed_at":"2026-05-17T02:18:52.324847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sc-captioner: Improving image captioning with self- correction by reinforcement learning","venue":null,"work_id":"038566ca-96d0-4992-9965-b0a64a15566c","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:9014cbd7ce0703720c4f9b627973e5b9e430d74076ee29e347623187d8a8a816","observation_id":"be23abb0-5110-4e32-841d-bccc4487b546","resolution":{"observed_at":"2026-05-17T02:18:52.849268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-05T02:09:19.150032Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":"2504.09641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-07-04T03:29:31.402219Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reason- ing","venue":null,"work_id":"11e3dd37-02ce-4677-bd0f-38017bd9b920","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:6838ab2a6b2cdbf998a4f96fc0c1b099339c474860e220a443f2df0b905dd587","observation_id":"7e940b54-6378-4f98-b9df-28dc33c57448","resolution":{"observed_at":"2026-05-17T02:18:52.321509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hacs: Human action clips and segments dataset for recognition and temporal localization","venue":null,"work_id":"c460c6c5-56a0-43a4-92d8-5e3e03f8970d","year":2019},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:bf36c83da3f10abf21cb5279f52e204fe1fad9c006684fc9d5021718589d70b2","observation_id":"6ff04040-ff6f-49d2-9d95-6d3bd7fc1f47","resolution":{"observed_at":"2026-05-17T02:18:52.846707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:53d9c43c2735aaf26e39b4719091f02105ac952b4f915bdd48de21bd4e1b778d","observation_id":"b5e099b8-c0de-49f0-bddb-704e8764274b","resolution":{"observed_at":"2026-05-17T02:18:52.317842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the video sampling and reasoning strategies for temporal sentence grounding","venue":null,"work_id":"ae16d391-7518-46c7-bca6-f20f252305f6","year":2022},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:672cc9d8304b44851013dc36ec2ce87e5f8d7efba39f08fe079fc76261afe279","observation_id":"72669cb1-ea7a-4f24-8e64-5a80eb90dc0f","resolution":{"observed_at":"2026-05-17T02:18:52.843915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":35,"verified_fuzzy":36},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 3 inbound Pith citation observations for arXiv:2512.03963."}