{"as_of":"2026-08-15T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cc3702b06874b78628a6b1877fb8d894e4c9f54f8f36c100240ed20a0253630","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:35:30.340013Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:35:47.754884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:45:46.078854Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.13919","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-07-01T13:45:46.078854Z","title":"Temporal preference optimization for long-form video understanding","venue":null,"work_id":"5e4a4026-d9c8-4c5e-8de8-3d9b52e6f34c","year":2025},"citing_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T00:44:30.558048Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2503.05236"},"observation_digest":"sha256:c91149a113bd66bb919adf85494ac93ef8ad7cb92862cea5576961e41b094b8f","observation_id":"07820ea5-d273-419d-b0f9-1712d3f3882c","resolution":{"observed_at":"2026-05-14T00:44:30.698805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-07T10:28:46.708160Z","title":"Temporal preference optimization for long-form video understanding.arXiv preprint arXiv:2501.13919, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.708160Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:72399b6d39472825b1bb1412a185502b9fff595514122aa060ef520ac83f58cf","observation_id":"94a971de-4074-476a-9cf7-63b5e04448ba","resolution":{"observed_at":"2026-08-07T10:28:46.708160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-07T05:51:07.841588Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-14T03:52:26.127649Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.841588Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:b56f63de2ab06b5950b56ad83fdcf583ac4f475bb3b33426330b5c123cbd9dd6","observation_id":"ad71e2fe-5895-4c17-814c-8f8992cfa555","resolution":{"observed_at":"2026-08-07T05:51:07.841588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-08-11T05:21:52.457685Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:4e1050f22e9636f378f84c6750d853f8be84cbb4260387a9fc7be53995701723","observation_id":"c4e058ca-8cf5-4bea-9fd7-7106af43756d","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.13919","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-07-01T13:45:46.078854Z","title":"Temporal preference optimization for long-form video understanding","venue":null,"work_id":"5e4a4026-d9c8-4c5e-8de8-3d9b52e6f34c","year":2025},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-10T22:41:15.175214Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:19.742035Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:15b38e39799d9bb9330e1bf7f9404b95d1b8e3f71243720e004c7eb722213faa","observation_id":"ae89cc00-7ed8-4799-a24e-f763409a485b","resolution":{"observed_at":"2026-07-01T13:45:46.080486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-03T00:18:46.708657Z","title":"Rui Li, Xiaohan Wang, Yuhui Zhang, Zeyu Wang, and Serena Yeung-Levy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-10T22:41:15.175214Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T00:18:46.708657Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:9a0c429f0301d245d6c5b77e92e8123dabacfd073c2d50bdbc96fad52fa8ecf4","observation_id":"ea400a07-fc86-4d12-83fd-776d02899ee7","resolution":{"observed_at":"2026-08-03T00:18:46.708657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":"2501.13919","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-07-01T13:45:46.078854Z","title":"Temporal preference optimization for long-form video understanding","venue":null,"work_id":"5e4a4026-d9c8-4c5e-8de8-3d9b52e6f34c","year":2025},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-14T09:35:12.467667Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:db4c8ceb5f22980a0cce7786b8c7c513866d95ac86d9a73866e25080e8c54b30","observation_id":"80fa6c11-be87-49d7-ac79-ab920f783b35","resolution":{"observed_at":"2026-06-30T07:54:22.386718Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-14T04:35:47.754884Z","title":"arXiv preprint arXiv:2501.13919 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08622","last_updated":"2026-08-09T10:09:11Z","snapshot_observed_at":"2026-08-14T18:16:41.305050Z","submitted_at":"2026-08-09T10:09:11Z","title":"VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-14T04:35:47.754884Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2608.08622"},"observation_digest":"sha256:fd97aaebafb07ad05193b2ba331a554cdd2507d45fa574fb45e96f22d7dafd0d","observation_id":"fa3d5b0d-9bba-4c10-99f3-c8a6c601656f","resolution":{"observed_at":"2026-08-14T04:35:47.754884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13919/citation-record","integrity":"/paper/2501.13919/integrity","json":"/paper/2501.13919/citation-record.json","paper":"/paper/2501.13919"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T15:35:30.052266Z","title":"Phi-3 technical report: A highly capable language model 12 locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.052266Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:254d29005ad92183eb60df30a62d0beebe6f918edb80d79e8e242bfb608998ab","observation_id":"6388fa38-6206-498b-8586-de772a5ed90c","resolution":{"observed_at":"2026-08-10T15:35:30.052266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T15:35:30.058831Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.058831Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:33de9cc9ecc47dbb2e861fc23602e39273afe80fabc3bb409bea9f54eb8632ef","observation_id":"af86cbbf-dd04-49a9-8b09-c85557555cc3","resolution":{"observed_at":"2026-08-10T15:35:30.058831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11280","last_updated":"2025-01-08T03:18:23Z","snapshot_observed_at":"2026-08-14T12:55:20.540711Z","submitted_at":"2024-06-17T07:33:30Z","title":"ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11280","snapshot_observed_at":"2026-08-10T15:35:30.065401Z","title":"i-srt: Aligning large multimodal models for videos by iterative self-retrospective judgment.arXiv preprint arXiv:2406.11280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.065401Z"},"links":{"cited_paper":"/paper/2406.11280","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:36e789e9c19793d7c957c550ab9d7bd03b608315c4a4fb886ee22b19b7f49cf6","observation_id":"ccd4f21c-0009-444f-95cc-21a91a44285f","resolution":{"observed_at":"2026-08-10T15:35:30.065401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03746","last_updated":"2024-06-17T08:20:33Z","snapshot_observed_at":"2026-08-13T04:25:26.631532Z","submitted_at":"2024-02-06T06:27:40Z","title":"Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03746","snapshot_observed_at":"2026-08-10T15:35:30.073317Z","title":"Tuning large multimodal models for videos using reinforcement learning from ai feedback.arXiv preprint arXiv:2402.03746, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.073317Z"},"links":{"cited_paper":"/paper/2402.03746","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:d5c182e253b1bd229ea64d66ae069c1f71ad7ad4526679f0866505a9571d6b6f","observation_id":"244a4b93-45c9-4d73-bedf-b8b6ef16fd29","resolution":{"observed_at":"2026-08-10T15:35:30.073317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T15:35:30.078522Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.078522Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:dc24d6e4c006db92a21037707edd17c5a8b6774a5097bd05be99486024b12283","observation_id":"50d9d4a1-7f72-4fc6-aebf-a59309f2e270","resolution":{"observed_at":"2026-08-10T15:35:30.078522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-15T22:29:09.141702Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T15:35:30.082895Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.082895Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:3fb95d6918a891f685703ada434e8b5428d37e4259ad2a9f033103589db9ca46","observation_id":"431f0539-0b9d-447c-9712-5c0ea0be68f2","resolution":{"observed_at":"2026-08-10T15:35:30.082895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-15T16:39:44.454451Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-10T15:35:30.088602Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability.arXiv preprint arXiv:2411.18211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.088602Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:0c776d53566a98d69c3b9bee586ec975a3a20ac1b21486aa758ceddf1d316245","observation_id":"178594a7-eaa1-444d-a2c1-a127bef70c95","resolution":{"observed_at":"2026-08-10T15:35:30.088602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:31.054752Z","title":"Large-margin contrastive learning with distance polarization regularizer","venue":null,"work_id":"cd25a283-019d-4cf4-82aa-719cf8328d00","year":2021},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.092665Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:ebd7c4681428bd3b0b697bff9c46fe2f50073238db6fe44e69fe38205971c622","observation_id":"0278fd76-9f7e-46f5-897f-4362c793b0fc","resolution":{"observed_at":"2026-08-10T15:35:31.058537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T15:35:30.097928Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.097928Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:95e338cb6a726c386924448d1cf9840a5ad4e85515d1496c0893871dd6b50363","observation_id":"89af25b5-0305-4b2b-9175-803d0c9c4187","resolution":{"observed_at":"2026-08-10T15:35:30.097928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.102854Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.102854Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:1c6770fe19e1f852bf8b035ba091c856577e2d04a1d05a191765cdd568baaad5","observation_id":"b6701107-79a5-4fcc-8e50-569efb463f4e","resolution":{"observed_at":"2026-08-10T15:35:30.102854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00927","last_updated":"2024-07-11T00:38:08Z","snapshot_observed_at":"2026-08-14T15:00:01.701956Z","submitted_at":"2023-10-02T06:41:30Z","title":"Understanding Transferable Representation Learning and Zero-shot Transfer in CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00927","snapshot_observed_at":"2026-08-10T15:35:30.107038Z","title":"Understanding transferable representation learning and zero-shot transfer in clip.arXiv preprint arXiv:2310.00927, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.107038Z"},"links":{"cited_paper":"/paper/2310.00927","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:829d8cdca25ba8d3beca45836c5784c12f1386267833d7b9dce157076936f78d","observation_id":"45e4da70-ee5b-4608-a319-f59ec92a4418","resolution":{"observed_at":"2026-08-10T15:35:30.107038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:31.036084Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":"9eb0bef7-d623-4324-844e-757053497a2a","year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.111836Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:d0a502dee0e880961cdc707e46332c642c2f8278f552408353d7724104732131","observation_id":"02aee7bf-126b-48ca-9cd2-908c8021e7b0","resolution":{"observed_at":"2026-08-10T15:35:31.040312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-15T00:31:30.908728Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-10T15:35:30.116631Z","title":"Video-ccam: Enhancingvideo-language understanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.116631Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:ac386903af74485f5a5b9c39d9128f25a3ca9de83ecee45b0c7801978e77ebd9","observation_id":"c8260679-dd87-454a-84e7-b9c06c9110d9","resolution":{"observed_at":"2026-08-10T15:35:30.116631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-10T15:35:30.121345Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.121345Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:872692b6bf8d0f988a14573766dfef7cb7b593b2ce5fd7b3aeb78638cf04e12c","observation_id":"90129829-1761-4e0d-8c4b-7998284f5cde","resolution":{"observed_at":"2026-08-10T15:35:30.121345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-10T15:35:30.125217Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.125217Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:8e08f2098bb1fadc1fe718af57f28af842d3dc41718ee0ed8dceedd65599d28e","observation_id":"be63f7ac-5fce-4683-9ddd-1052420ac8cc","resolution":{"observed_at":"2026-08-10T15:35:30.125217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:31.024312Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"785a2956-6cf1-4d70-ab07-06b57a4ec31b","year":2017},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.129019Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:456083a0b6b1aa0d0a42f9a31529f4ca9ac2be59b36b63d9bcfc444a45ab1d17","observation_id":"3005a8aa-3314-4506-8c76-f3a7083a177c","resolution":{"observed_at":"2026-08-10T15:35:31.028835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.132541Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.132541Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:1b03bedb8d7adad1550e6922fe65363d3c858461b74d6195cf74e52f778175d1","observation_id":"7fd242ed-fd9e-41b5-870a-6cb38cf9afcb","resolution":{"observed_at":"2026-08-10T15:35:30.132541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-13T13:18:22.882788Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-10T15:35:30.136285Z","title":"Large language models are reasoning teachers.arXiv preprint arXiv:2212.10071, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.136285Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:4a78453b8b812b9d4a47ded4b4e2a06ada63fb711353ff0372c264acf26c8b8e","observation_id":"0ae9fa5b-c640-4e58-930a-cc0726152325","resolution":{"observed_at":"2026-08-10T15:35:30.136285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T15:35:30.140139Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.140139Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:5aa6af80a00ae55e36c87560855a2a9f14adb6cd30d607507d8a91049325ee7b","observation_id":"5f20bb0b-ca90-4602-96a2-3f33908ac49d","resolution":{"observed_at":"2026-08-10T15:35:30.140139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:31.006505Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"01a58e17-cf0e-4d53-a3d7-2140b96918a0","year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.143440Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:6a615a28c641a0bbcfb9b9de67f9a5417a13a0ca7ef6c9525b40a191bf1437bc","observation_id":"9edc5c85-44d2-4ab4-baae-56f8187c86ac","resolution":{"observed_at":"2026-08-10T15:35:31.010533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-10T15:35:30.146705Z","title":"Large language models can self-improve.arXiv preprint arXiv:2210.11610, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.146705Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:dfcc1e80b7ac40739b4ae98e138b4b84c67b550b35411987819bd437c321084f","observation_id":"b4a7e62e-a4b8-46d8-8c5d-4fda27ffe16c","resolution":{"observed_at":"2026-08-10T15:35:30.146705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.994318Z","title":"Bimba: Selective-scan compression for long-range video question answering","venue":null,"work_id":"7978d8a5-695f-4e6e-9f35-c535e81cf47a","year":2025},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.150125Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:49a01f3dd95d2f8740c0299c199e1327e0e48c03565ff87b87ea713634d1a65f","observation_id":"9f19911a-5b01-4695-93f5-d749ae93e01c","resolution":{"observed_at":"2026-08-10T15:35:30.998517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.153194Z","title":"What matters when building vision-language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.153194Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:9b1fa642dca76f06c80ea4c85cc8ebc1c672f05b0bdbb1aedf8a9e971d7c26f6","observation_id":"78f59d88-b517-4a00-b2be-32e334da12ca","resolution":{"observed_at":"2026-08-10T15:35:30.153194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.976271Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":"e0d27526-78ec-4ba4-8cf1-480af8a8e82b","year":2021},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.156129Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:95fe12a2b856b3eeb9a5a51c76114f09012808fe033c001b96691275bea2a17a","observation_id":"50c563c7-d614-4ab2-861d-1e102fba0451","resolution":{"observed_at":"2026-08-10T15:35:30.980478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:35:30.158917Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.158917Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:972201f0cdf7c8616bd8e1d30572c9a57df5bacbca5248621075e66194f501df","observation_id":"6d969358-0c24-4406-bef4-d42986ae8cd2","resolution":{"observed_at":"2026-08-10T15:35:30.158917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-12T22:28:12.899379Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-10T15:35:30.162277Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.162277Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:ad4b2cff7e85171b1ccc9c368b3c3154926b204e42c87f345f8f419122f00e0d","observation_id":"4205c792-fcd8-44b6-aa00-cdcc428a21c9","resolution":{"observed_at":"2026-08-10T15:35:30.162277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.964697Z","title":"Llava-next: Tackling multi-image, video, and 3d in large multimodal models, June 2024","venue":null,"work_id":"d6aec6dd-73ad-4ecb-a1e9-d93ee0e7ffc3","year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.165888Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:900f43992cd1547e52c230b8a467337103b96c46409fdf23335cdb53538427df","observation_id":"3e83448f-87fd-4b04-a40e-c81e2a3900a3","resolution":{"observed_at":"2026-08-10T15:35:30.968842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-10T15:35:30.172948Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.172948Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:7ee466e452bfbbfb38f74297f78d00a56caadfa3c926dcca26363790adc86c13","observation_id":"a4755349-b04c-4fda-8bd6-7c526c9e1545","resolution":{"observed_at":"2026-08-10T15:35:30.172948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-14T22:44:19.960779Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-10T15:35:30.176415Z","title":"Silkie: Preference distillation for large visual language models.arXiv preprint arXiv:2312.10665, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.176415Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:350249d822b449f4062181f774cd388e8cfa4c2cdcd6b3a95e95897b5546de3d","observation_id":"8e534273-46d3-4802-b811-757a84634a33","resolution":{"observed_at":"2026-08-10T15:35:30.176415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-10T15:35:30.180773Z","title":"Video-llava: Learningunitedvisualrepresentation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.180773Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:13bebf292e07bd5eba0ab8ed78bb7d48d307687482d97cf6aee2ec6317ef4c69","observation_id":"43647c39-46b5-4224-9489-403e3bbd2b17","resolution":{"observed_at":"2026-08-10T15:35:30.180773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.184563Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.184563Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:c53960dc6b1de5afc4f5b0fc08fe44795f8d9986cbf7aaa92678d35691c5efa2","observation_id":"75b6d04b-cfdc-41b8-bc66-749917494c59","resolution":{"observed_at":"2026-08-10T15:35:30.184563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.187975Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.187975Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:afa269776349143525134cfadb6b99e5132f510fb09c04be144470b11a364aad","observation_id":"2fa9da1c-f4f2-4c5b-aa50-9e24f619ce23","resolution":{"observed_at":"2026-08-10T15:35:30.187975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.940761Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"60a8c7f0-78fe-4d6f-8e44-1c77153476ae","year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.191942Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:66dd99c7b7cc691dc77bc09fc87804398d58eeec156a53166a7ac9126c0655ef","observation_id":"f1414b7e-854b-45fe-b45c-5f502fa584fb","resolution":{"observed_at":"2026-08-10T15:35:30.944875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-13T04:53:28.750571Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-10T15:35:30.195645Z","title":"Kangaroo: A powerful video-language model supporting long-context video input.arXiv preprint arXiv:2408.15542, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.195645Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:08920204536f69ce26ed6ccb764aa528d2caba98281666b08fb602d194f89319","observation_id":"c71c0487-de8e-48a9-ac5f-a66dde5d4b27","resolution":{"observed_at":"2026-08-10T15:35:30.195645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-10T15:35:30.199392Z","title":"Nvila: Efficient frontier visual language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.199392Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:e20416ae298b13b7ecc5568ee4c2bfd26f1a6397de596d44c0147076fa5b9b3a","observation_id":"d33a54a7-9b41-4224-8a20-4010fe75f9eb","resolution":{"observed_at":"2026-08-10T15:35:30.199392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-10T15:35:30.203011Z","title":"Oryx mllm: On-demand spatial-temporal understanding at arbitrary resolution.arXiv preprint arXiv:2409.12961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.203011Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:fc4bf05527edf02030f8c3a7a28babbc07f942d8015922b2c2bf878aa02d29f2","observation_id":"83e485c8-b2cd-4efe-bf0c-123b9c521a66","resolution":{"observed_at":"2026-08-10T15:35:30.203011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-10T15:35:30.207074Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.207074Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:e84583013f0dbe3bbae91de6b22aebaafbeeff20c49068524184ace014526942","observation_id":"6f5b5fd2-90fd-42e7-88d8-8f0f30c49746","resolution":{"observed_at":"2026-08-10T15:35:30.207074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.210839Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.210839Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:705ef6940859be2fe10b78dda95bd31fb5238544fbeef0a6c9a2e6343049735e","observation_id":"d4def448-4799-4251-9c34-6e43bffc9157","resolution":{"observed_at":"2026-08-10T15:35:30.210839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.923189Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":"264304a3-df85-4299-aad4-56f8f67ce541","year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.214485Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:2f1c556578cc92c31c771e01fb974e43bd6b88096982b3d9297525d0f759588f","observation_id":"8e65e415-d391-4ba6-8474-01141e1bd17b","resolution":{"observed_at":"2026-08-10T15:35:30.927008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.217991Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.217991Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:6735aff28b6f96a7a011adfab4cd786b8c342e24dcefc03217152c98042132db","observation_id":"7150d3db-2156-4f82-b1c1-53c00ae1c930","resolution":{"observed_at":"2026-08-10T15:35:30.217991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.221878Z","title":"Generative agents: Interactive simulacra of human behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.221878Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:be6a96ba36d65fb9cc4298b47434403720459577ffda6635563b5c4162b5cd48","observation_id":"608135bd-2053-4086-82d0-8c3c25d82d2f","resolution":{"observed_at":"2026-08-10T15:35:30.221878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08730","last_updated":"2024-04-03T15:22:23Z","snapshot_observed_at":"2026-08-13T00:54:56.865985Z","submitted_at":"2024-03-13T17:29:45Z","title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08730","snapshot_observed_at":"2026-08-10T15:35:30.225400Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization.arXiv preprint arXiv:2403.08730, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.225400Z"},"links":{"cited_paper":"/paper/2403.08730","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:3ebd77f525de90ea8d6f5fb285962c1c610866d58a564fd956a97bcd270f5d83","observation_id":"9bff6494-6963-4327-9d17-c0c336f63cc3","resolution":{"observed_at":"2026-08-10T15:35:30.225400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.229228Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.229228Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:ab659720e497338d2163de00752b38f8c23b2194f9ab43e981303f5832f75227","observation_id":"e2dc9ba7-19b0-4187-92a4-e105f8c5bc76","resolution":{"observed_at":"2026-08-10T15:35:30.229228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T15:35:30.232886Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.232886Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:36cb4afdc1f5cd60a8b6548294278bb48651286524d2e5996af6a1e6d36ce91c","observation_id":"d43587ee-2bb1-4c20-80ae-0a42361f05f9","resolution":{"observed_at":"2026-08-10T15:35:30.232886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.236757Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.236757Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:0bddfd54585657392329ad960d217e93e8424fa19eab5b3661dc5d4e31eba997","observation_id":"252355a5-fb54-4144-841f-c37f1284835a","resolution":{"observed_at":"2026-08-10T15:35:30.236757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-10T15:35:30.240530Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.240530Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:903e8888668c6ab65390975dfc037d78e8420d1ef77ef1b9339d9951b565e319","observation_id":"9e670a45-50be-4d6a-beb9-9f45701052e8","resolution":{"observed_at":"2026-08-10T15:35:30.240530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-15T03:08:15.732831Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-10T15:35:30.244486Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.244486Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:93e23797ce4f7a844dc2aac92da9d67274aba2034143ea09a54beb599faa2df4","observation_id":"7b71ba94-2146-45e8-8a0f-07d06ad2a63e","resolution":{"observed_at":"2026-08-10T15:35:30.244486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.250453Z","title":"Learning to summarize with human feedback.Advances in Neural Information Processing Systems, 33:3008–3021, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.250453Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:5c1ea5813a199f638b1b18f04d9494984291eaaa1e141ec42d05d4eebb359b47","observation_id":"d6fc0a06-e86d-44eb-a151-a975c8419f00","resolution":{"observed_at":"2026-08-10T15:35:30.250453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-10T15:35:30.254242Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.254242Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:584efbd0d7dd1a7f59bced733747133c0012ed18dfdae1dc7dabbdfadcc0e51f","observation_id":"4bca69db-3c72-4332-a9d5-349878114619","resolution":{"observed_at":"2026-08-10T15:35:30.254242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-12T22:30:54.111905Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-10T15:35:30.257411Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.257411Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:f8c74d6db436c2610d418bee5cc23ace8d6184b7e6ea323fe6c79b952b207f82","observation_id":"ce014ffa-038b-4798-a758-e213929b9342","resolution":{"observed_at":"2026-08-10T15:35:30.257411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T15:35:30.261192Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.261192Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:551b222d0be27da0f20d19f6d32e08229d41030f88f161e52f8e6e488dfbec26","observation_id":"7c611c7e-9fc9-4b3a-b831-d5b91c8a66be","resolution":{"observed_at":"2026-08-10T15:35:30.261192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.880951Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"fc26d9d4-ec54-43de-a5e1-61a886ab083f","year":2021},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.264527Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:6bb78ddd8b4557d0d94828611392f74856dc59478b7294af63545b6d08dfe5b5","observation_id":"e66732ff-36fd-445a-95a2-600bd9949f16","resolution":{"observed_at":"2026-08-10T15:35:30.884727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.869599Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"650a6704-5b69-4623-afb3-b15950ad9930","year":2025},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.267901Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:07f1412a44159489fe53460245baf43e89db2c6499082eb74aba1c78b190f19e","observation_id":"40077cef-3a59-4d9b-94d4-828df56a57a2","resolution":{"observed_at":"2026-08-10T15:35:30.873713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-10T15:35:30.270844Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.270844Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:0f57329bee7256900750e7a75e3a4fef08c6ca2df924803e810874b3b1ca2359","observation_id":"41e79b09-b4b4-4c5d-a509-1a2bda6a9979","resolution":{"observed_at":"2026-08-10T15:35:30.270844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.274095Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.274095Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:b0b7020345e2e61c0604212251b764ca58a23da5ecfc1a490335bd64d3501816","observation_id":"78e2b051-dc7c-4cb7-8613-23b21e81a885","resolution":{"observed_at":"2026-08-10T15:35:30.274095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.277584Z","title":"Pllava : Parameter-free llava extension from images to videos for video dense captioning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.277584Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:bc4acc849addca315909e4c71befdc9368ec89c02d92601e3d3d67a99bc2688e","observation_id":"71444874-7339-4630-913f-031016faf40a","resolution":{"observed_at":"2026-08-10T15:35:30.277584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.281216Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.281216Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:689ef3418cc93a496a3f123cfff21e3e108075913f0bbd145e846b612e8010ca","observation_id":"ec269b35-c878-4a5c-ac71-0163e9a852a7","resolution":{"observed_at":"2026-08-10T15:35:30.281216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T15:35:30.284542Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.284542Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:5c6ac7c1ba8d27c4d0ab5c9169c4ee6cde3e341914ad4303f9a863ee0799d521","observation_id":"7f1bde46-37a7-46b4-92ce-81e5ab375542","resolution":{"observed_at":"2026-08-10T15:35:30.284542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.839836Z","title":"Every moment counts: Dense detailed labeling of actions in complex videos.International Journal of Computer Vision, 126: 375–389, 2018","venue":null,"work_id":"4f076f26-1c04-49f1-a824-5d8ceae19e24","year":2018},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.288209Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:fecd44c32a544128beabf7611e6b05bab78c55642f85e1fe992fd5bc4cfa502f","observation_id":"ac5b31d3-66bf-4961-9f14-d033c55cc6dd","resolution":{"observed_at":"2026-08-10T15:35:30.843308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.829224Z","title":"aws-prototyping/long-llava-qwen2-7b, 2024","venue":null,"work_id":"548652bb-b088-4b03-aecd-734f1c69385f","year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.291607Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:8c58c41305db6b05a4eacba267fd989b228f8e81a1e5cdd0bb81b35f3cb2d1aa","observation_id":"1f5289d5-c8d3-493b-813a-3d85fde8b2fe","resolution":{"observed_at":"2026-08-10T15:35:30.833065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.295157Z","title":"Semantic conditioned dynamic modulation for temporal sentence grounding in videos.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.295157Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:79635ec6bb947b862ecbb5eeb10ff658b469247df9d473d80a4a9c618f09a440","observation_id":"8bfbdaa9-e89c-44bf-ba55-5dd07e84a98f","resolution":{"observed_at":"2026-08-10T15:35:30.295157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.298352Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.298352Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:678cadaf70479de4cb74d1cee9c6f154ada543a25e3b6014b465b6a15b52d051","observation_id":"6c296809-5d39-478b-a984-d512c1931a7b","resolution":{"observed_at":"2026-08-10T15:35:30.298352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-10T15:35:30.301738Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.301738Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:65f827e6074c97f6cdc108060a70a75ec2d4857d35a7c911b21999fca3caa85a","observation_id":"5b9854d1-d8a6-4e5e-b9a3-3af0b15ddcbb","resolution":{"observed_at":"2026-08-10T15:35:30.301738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T15:35:30.305277Z","title":"Longcontexttransferfromlanguagetovision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.305277Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:e53eb2f0d6fa0f2655c0fddb67c7958dceae16365c0b98947c9b66d0b92d9edf","observation_id":"cfb261d3-c08a-4034-8835-35aad62cee14","resolution":{"observed_at":"2026-08-10T15:35:30.305277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-13T00:39:57.337984Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-10T15:35:30.309108Z","title":"Direct preference optimization of video large multimodal models from language model reward.arXiv preprint arXiv:2404.01258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.309108Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:5edf9c722190769da87390562e59d5e1d20ec6301191880da9bcc7ed9d6f9451","observation_id":"908c1f38-1639-40e4-aa1a-2ecadfba7fd6","resolution":{"observed_at":"2026-08-10T15:35:30.309108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:35:30.802766Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":"bd55c42f-be5c-4a34-87e4-e5e91738dff0","year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.312880Z"},"links":{"citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:3d3d5de0447dc84ea6fbf605f16c408fb033f5ee6666291021daf6b4b8f15dd1","observation_id":"efe6e47c-5173-4d10-9d5c-a440411f6d01","resolution":{"observed_at":"2026-08-10T15:35:30.807930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-10T15:35:30.317413Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.317413Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:941ef80efef84591eb98a2f8973b2d4eea76a1fa7d86294b3bb3f19d36d009a3","observation_id":"10ba334a-bb4c-4f00-b439-b1f38cf09b18","resolution":{"observed_at":"2026-08-10T15:35:30.317413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-10T15:35:30.320936Z","title":"Beyond hallucinations: Enhancing lvlms through hallucination-aware direct preference optimization.arXiv preprint arXiv:2311.16839, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.320936Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:8f956fb33c4cfa4470373df4216dbe9e2c6a317bd70b2701c8ec1b1bb51a756c","observation_id":"4fb06a6a-0640-451b-9394-8c264991c1fd","resolution":{"observed_at":"2026-08-10T15:35:30.320936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-10T15:35:30.324482Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.324482Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:e9e15c20cb36f0e78895a9babdf2696c60039d66d3b084eb40c99ab5f193aca6","observation_id":"3218d2ec-b6a7-41f5-9998-e47532f8c3ff","resolution":{"observed_at":"2026-08-10T15:35:30.324482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-10T15:35:30.328632Z","title":"Aligning modalities in vision large language models via preference fine-tuning.arXiv preprint arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.328632Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:4bb0c07f16903fe5d34a33d603a641680f22079739c8ac0e9c76db126bed8e36","observation_id":"0b26ef39-f39e-4129-bef5-86dbb0056aa0","resolution":{"observed_at":"2026-08-10T15:35:30.328632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-15T10:46:42.452851Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-10T15:35:30.332097Z","title":"Fine-tuning language models from human preferences.arXiv preprint arXiv:1909.08593, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.332097Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:371a45f9895b5003eb7b03ae636ba49cb2d7e81c5ee2f338f4c33886912afc10","observation_id":"c659258e-d00f-41d3-8a28-946ddb101ae7","resolution":{"observed_at":"2026-08-10T15:35:30.332097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06189","last_updated":"2024-07-08T17:59:42Z","snapshot_observed_at":"2026-08-14T02:33:37.224149Z","submitted_at":"2024-07-08T17:59:42Z","title":"Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06189","snapshot_observed_at":"2026-08-10T15:35:30.335661Z","title":"Video-star: Self-training enables video instruction tuning with any supervision.arXiv preprint arXiv:2407.06189, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.335661Z"},"links":{"cited_paper":"/paper/2407.06189","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:c91b9153e8c7747ee1be23fe77c35babbd1d0cfb1fee3dc051e7a3b8a75437b7","observation_id":"cbd74da5-b010-4ae6-9fc1-70794fdbb2eb","resolution":{"observed_at":"2026-08-10T15:35:30.335661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-15T17:40:10.309874Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-10T15:35:30.340013Z","title":"Forward, Warrior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.340013Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:8ba83e53285c56ae23134a513ddd8bec06d7a3b3b70dc6de18f2b90bafa5a036","observation_id":"bae030c5-b38e-4907-8317-21555e5d6524","resolution":{"observed_at":"2026-08-10T15:35:30.340013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 8 inbound Pith citation observations for arXiv:2501.13919."}