{"as_of":"2026-08-14T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7094d3e2130979892737523e668f5170cff570693d164e766ef10c00ab6f983","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:50.329904Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:30:02.227226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:08.052620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-08-03T09:30:02.227226Z","title":"Fostering video reasoning via next-event prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-08T07:44:31.776591Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:02.227226Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:23ef46eaa5ea5b399f3b0588d311d12fb985368ef3089b05d765e99fd2de69f3","observation_id":"999cd9e9-7450-41b6-81d1-bffa35dbba45","resolution":{"observed_at":"2026-08-03T09:30:02.227226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2604.19564","last_updated":"2026-04-22T03:52:37Z","snapshot_observed_at":"2026-08-11T17:03:21.591027Z","submitted_at":"2026-04-21T15:15:02Z","title":"EgoSelf: From Memory to Personalized Egocentric Assistant","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:21.119521Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2604.19564"},"observation_digest":"sha256:70a0a00a3c5524edf1967b3d9e3ca8394d16aeaedc9a5167dfde4f4da22b5713","observation_id":"9a9dbaae-8460-4fa6-a39e-5f07afa41cf8","resolution":{"observed_at":"2026-05-11T13:06:03.692100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2604.23348","last_updated":"2026-04-25T15:10:25Z","snapshot_observed_at":"2026-08-11T11:45:16.569212Z","submitted_at":"2026-04-25T15:10:25Z","title":"EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T08:34:14.297331Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2604.23348"},"observation_digest":"sha256:f7c97fbf37b30ec16eb9c958b81befd1d9ca1066b314570ce37c724487f9ca88","observation_id":"d5dbfd85-61ed-4384-aae0-8589d7c3ab8a","resolution":{"observed_at":"2026-05-11T20:31:15.231278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-13T09:56:57.676160Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:7286354cc5fcf9e8d1c5ec609480e13a0e32c25455b22aa0aca6cd6a1d29312a","observation_id":"b5ace437-a666-4879-885c-3a35be18a4dc","resolution":{"observed_at":"2026-07-02T11:56:55.449447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"cited_work":{"arxiv_id":"2505.22457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22457","snapshot_observed_at":"2026-07-04T19:30:08.052620Z","title":"arXiv preprint arXiv:2505.22457 (2025)","venue":null,"work_id":"042bea91-49fa-4eae-a05d-5ddec5e3b8f7","year":2025},"citing_paper":{"arxiv_id":"2606.25585","last_updated":"2026-06-24T08:56:48Z","snapshot_observed_at":"2026-08-14T19:02:04.945556Z","submitted_at":"2026-06-24T08:56:48Z","title":"FeVOS: Foresight Expression Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-25T21:13:21.500674Z"},"links":{"cited_paper":"/paper/2505.22457","citing_paper":"/paper/2606.25585"},"observation_digest":"sha256:2f5f319ecfadfe9bc994aa83251d709fb969f61bf569ad60dc50122e7390ff68","observation_id":"416437f4-13df-4c83-977f-687485dc6d1b","resolution":{"observed_at":"2026-07-04T19:30:08.053934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22457/citation-record","integrity":"/paper/2505.22457/integrity","json":"/paper/2505.22457/citation-record.json","paper":"/paper/2505.22457"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:10:39.795809Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:39.795809Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:27d3f0a16f028c876b023798e7f616553f87c18ed51a19ce04b7541734e4c58b","observation_id":"a8b243e2-10bb-45c5-9874-d119d25b607b","resolution":{"observed_at":"2026-08-07T13:10:39.795809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:10:39.920205Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:39.920205Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:1a97781e8d48c2a761696ebfc89197c70fc9663a4c9ee12ca179581aa6cfd7b4","observation_id":"e1344f05-fac6-4083-b108-4d82a83f50ae","resolution":{"observed_at":"2026-08-07T13:10:39.920205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:10:40.123547Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.123547Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:7234cfc802d1532ed1cf1f45e86a719d5cea354e1d933ea2b506ff9dc7598ea0","observation_id":"f7b28bc2-524b-4bd9-828b-d89f18750afa","resolution":{"observed_at":"2026-08-07T13:10:40.123547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.730155Z","title":"Perspective—discovery within validation logic: Deliberately surfacing, complementing, and substituting abductive reasoning in hypothetico- deductive inquiry","venue":null,"work_id":"78b57d0d-eadd-439d-92f0-31c5ff0523ab","year":2018},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.267143Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:a959165466ebcfc2ac97bc165908292eeda4f0983515d30fdb2322b86cb4c38e","observation_id":"b97c9119-9168-41fa-acfe-81ee98f6fb38","resolution":{"observed_at":"2026-08-07T13:10:58.806676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-12T22:23:25.864838Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T13:10:40.431117Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.431117Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:fa75aca674729e66a15e88ace5008bf98cc1b48b6e3f237d49ed0952dcfa5eaf","observation_id":"8c97c53f-09c4-49cc-a2be-eebe6f273efc","resolution":{"observed_at":"2026-08-07T13:10:40.431117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24376","last_updated":"2025-03-31T17:55:23Z","snapshot_observed_at":"2026-08-07T16:19:42.924626Z","submitted_at":"2025-03-31T17:55:23Z","title":"Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24376","snapshot_observed_at":"2026-08-07T13:10:40.647005Z","title":"Exploring the effect of reinforcement learning on video understanding: Insights from seed-bench-r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.647005Z"},"links":{"cited_paper":"/paper/2503.24376","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:2959e9540a5793f34faff126ef0192378ea12b39c87de9c5c4c4cff8e0620bb4","observation_id":"1ef549fe-3383-4fb6-8f03-86eaa348bf98","resolution":{"observed_at":"2026-08-07T13:10:40.647005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00114","last_updated":"2024-08-07T00:52:07Z","snapshot_observed_at":"2026-08-13T16:34:56.870318Z","submitted_at":"2024-07-31T18:47:11Z","title":"Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00114","snapshot_observed_at":"2026-08-07T13:10:40.763426Z","title":"Inductive or deductive? rethinking the fundamental reasoning abilities of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.763426Z"},"links":{"cited_paper":"/paper/2408.00114","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8f696c277229f11e3ee5e45104ef7bd0d292c2d13ec24459468198f124f962f4","observation_id":"0791a0bd-f9d3-47f2-86ad-e93cedb888e3","resolution":{"observed_at":"2026-08-07T13:10:40.763426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-12T22:26:31.050613Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-07T13:10:40.921513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.921513Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:4acd51c04f0dc0c4b29d5031659fad28c3d901111a41aba23cd2d2224cad77f5","observation_id":"ec8e0ee3-de3c-4682-8d6c-becc925384ba","resolution":{"observed_at":"2026-08-07T13:10:40.921513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.543199Z","title":"Abduction","venue":null,"work_id":"531fd090-1247-4a67-b81d-e569f505faa0","year":2021},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.070272Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:f5bfb9984a76eb7c0d5f4562deb0553862cb78679b725f73c79d3ac6a72213d1","observation_id":"fbbad63a-714e-4059-9099-f57c7e3879de","resolution":{"observed_at":"2026-08-07T13:10:58.638631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T13:10:41.225273Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.225273Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:ff3da27aace9c9b8c5651d9257a75ef849011c504a48d30ea0c09135028b7e9d","observation_id":"1b26eba1-f86e-44d0-a8c9-12b66e821277","resolution":{"observed_at":"2026-08-07T13:10:41.225273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.252850Z","title":"Predicting the future: A jointly learnt model for action anticipation","venue":null,"work_id":"1714ae83-e08b-4a0d-ab31-38e5c387b6a3","year":2019},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.432388Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8bc844ef1bd547123e8f7b061319079f214dddca345add4ac8aeb5f2c02c177d","observation_id":"2e760cb1-9cb8-4792-91bb-0b81ab3a281b","resolution":{"observed_at":"2026-08-07T13:10:58.366839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:58.028627Z","title":"Inductive and deductive reasoning","venue":null,"work_id":"b27620ca-004e-4b90-9f9e-7fa49d23bdcf","year":2010},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.566747Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:57b7f8d87ce71d3eda4a8bfdd167ef163ffaf1e05f9448544702e1bbfd381d17","observation_id":"9b41be81-a1e1-4170-869d-90f1cb2964ec","resolution":{"observed_at":"2026-08-07T13:10:58.139151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:10:41.740834Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.740834Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:29a09f6696c913c8b335dbfb58053e6e8566e6823bb804e64786a9ddfe95707c","observation_id":"da3b778a-9a18-401d-8f84-3217ffe933f1","resolution":{"observed_at":"2026-08-07T13:10:41.740834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-13T13:18:22.882788Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-07T13:10:41.915486Z","title":"Large language models are reasoning teachers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:41.915486Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:4ec0500554d92c24ae13dcf720fe383f768f752f7476d551dfbea222ff0b1082","observation_id":"96b992c6-8922-45e8-99df-b3e8f37d511e","resolution":{"observed_at":"2026-08-07T13:10:41.915486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:10:42.048397Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.048397Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:fe052d730b10f683d04daf1fb998d8e0137b1fb52b9018b0241a9264b47ec85e","observation_id":"3b1b8a55-698f-4d8f-be06-2c98a3185948","resolution":{"observed_at":"2026-08-07T13:10:42.048397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:57.745557Z","title":"A hierarchical representation for future action prediction","venue":null,"work_id":"c71afa5d-02ab-40c8-90cc-41f962102c9c","year":2014},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.221938Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:659667ec5ce2fa8bea77fbaec085960b26d50fc3be3a1c596eaeea787557acc5","observation_id":"14476e3b-fe1c-4b0a-b790-b5bb495e1be7","resolution":{"observed_at":"2026-08-07T13:10:57.895421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:10:42.300383Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.300383Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b7135569f8305674bcaf62c1bd64febeb6f2e52c6a74b2c77eb7a4ac3518562c","observation_id":"59de5145-1f66-4698-94f4-6ffbe66328ce","resolution":{"observed_at":"2026-08-07T13:10:42.300383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:10:42.429393Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.429393Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b654850fda786208fd543c5b44cad7c27f7a17ee1204e033c7a5fff89cc8a712","observation_id":"481d3352-d8e1-4c05-97e5-2b773533b625","resolution":{"observed_at":"2026-08-07T13:10:42.429393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.566011Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.566011Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:6da417028eb3489b7192794071b9a555cd68753838126b3808edbd6d8ea3e138","observation_id":"a60049e2-c685-48d0-a8f6-1cad7c51724f","resolution":{"observed_at":"2026-08-07T13:10:42.566011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.721721Z","title":"A survey of multimodel large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.721721Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:f7632030658fd51c3fb2098255fc9454a776de46a9c72d56264c1ddadb28376e","observation_id":"450bb94b-80e9-4bc3-ae25-9225c7105aa6","resolution":{"observed_at":"2026-08-07T13:10:42.721721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T13:10:42.860422Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.860422Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:66e8ff8d280aa74e92f4199a259a20aca650ad57a5baf515a7986f0d7eb684f3","observation_id":"84733f08-cbc8-4014-8a9b-a32583d0674b","resolution":{"observed_at":"2026-08-07T13:10:42.860422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.994162Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.994162Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b1ec83c5060f74055b55008adfe8280e855a3af335c57a54aaf4bc384bfa9bfb","observation_id":"0160fd17-3872-42e9-8f2a-753a0538dea6","resolution":{"observed_at":"2026-08-07T13:10:42.994162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T13:10:43.177211Z","title":"Tempcompass: Do video llms really understand videos? arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.177211Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:f9c8c46212bf25a6ff9907c0d5ed8085d8c2437f221026bd3575142213d0af92","observation_id":"fc1f4c3c-6c0f-41b0-a710-4a3506c49205","resolution":{"observed_at":"2026-08-07T13:10:43.177211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.311301Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.311301Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:c36003947e0ced9e91b7c250d8b72ebc50a49aba4db450ddb98bdb50bf54b50e","observation_id":"afe341c0-7073-4c1d-882c-34ab70420a31","resolution":{"observed_at":"2026-08-07T13:10:43.311301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.456195Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.456195Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:05dd61483822e79f796bbfdaf704872b2dff9b0da7ee9984fea742852e061c93","observation_id":"a9610f74-06b6-42ca-8980-6a344a6c5767","resolution":{"observed_at":"2026-08-07T13:10:43.456195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6604","last_updated":"2016-05-04T14:01:42Z","snapshot_observed_at":"2026-07-06T04:04:18.621124Z","submitted_at":"2014-12-20T05:05:51Z","title":"Video (language) modeling: a baseline for generative models of natural videos","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6604","snapshot_observed_at":"2026-08-07T13:10:43.584292Z","title":"Video (language) modeling: a baseline for generative models of natural videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.584292Z"},"links":{"cited_paper":"/paper/1412.6604","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5095b5b03f15d28a8c4efb5d9ce89935a6176b59f2f64efdcbc8461d62153824","observation_id":"454627e6-d7b8-46a8-8f4f-5d3637e20f86","resolution":{"observed_at":"2026-08-07T13:10:43.584292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:10:43.689968Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.689968Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:281cbea2fad0bd46de3877b415413d921ee525fbaf23f2ee426584943b243cfb","observation_id":"633a548a-9fec-4e11-aa6c-8bd1ebd3fa99","resolution":{"observed_at":"2026-08-07T13:10:43.689968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T13:10:43.851289Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.851289Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:0fc3875e4da86ece96bb0606fed8efe2ec62012f816dd3d1fbe4aac190716384","observation_id":"9bf018a1-6fb0-448d-b95e-efa4b250609d","resolution":{"observed_at":"2026-08-07T13:10:43.851289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-12T22:42:16.155601Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-07T13:10:43.988173Z","title":"To cot or not to cot? chain- of-thought helps mainly on math and symbolic reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:43.988173Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e2ab18977346ca912f23358cc01d892177c44e469a5331a5a2bcfac13fdbd282","observation_id":"f42e9495-07d5-43ff-a659-14d3113954da","resolution":{"observed_at":"2026-08-07T13:10:43.988173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:57.435650Z","title":"The wisdom of crowds: Temporal progressive attention for early action prediction","venue":null,"work_id":"cf9cce29-f5a8-4591-9d75-b7b322a24f71","year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.194165Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:ba6c648a56b54e7bc8834006d0c5b8928b25223128f088363616adff1e702da7","observation_id":"e931fd75-e0b7-4087-af4f-9c8819e9dbff","resolution":{"observed_at":"2026-08-07T13:10:57.587779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.360273Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.360273Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8bb770ae236a87f5a6b908a91ab386f66c8bf418e69f1bcc61f8923a7888eade","observation_id":"f8ba82e5-fe4e-461e-8d5e-52c2b8254de2","resolution":{"observed_at":"2026-08-07T13:10:44.360273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:10:44.672213Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.672213Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:9227086bf97bbbd6e5f67d9a3ba420507340df09e07d0d272b0ccd956085495d","observation_id":"5465fe51-8e45-4d3b-86f2-106cb8700161","resolution":{"observed_at":"2026-08-07T13:10:44.672213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.830136Z","title":"Generating videos with scene dynamics","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.830136Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:183dc3bcf08b99772ed9effbaed371828683e3bfb348ab2f5984de1c5110bf0f","observation_id":"02023953-c1a5-41ac-8ba0-e57c4663e488","resolution":{"observed_at":"2026-08-07T13:10:44.830136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17703","last_updated":"2025-03-29T15:21:55Z","snapshot_observed_at":"2026-08-10T04:31:53.577547Z","submitted_at":"2025-01-29T15:20:30Z","title":"Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17703","snapshot_observed_at":"2026-08-07T13:10:44.921265Z","title":"Critique fine-tuning: Learning to critique is more effective than learning to imitate, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:44.921265Z"},"links":{"cited_paper":"/paper/2501.17703","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:75de19a5e10cceb5939323178c7843438a3e9e4f80f2e1335451906b0f1f9ff1","observation_id":"761182a1-f92a-4d9d-b1f1-15faf9eef1d0","resolution":{"observed_at":"2026-08-07T13:10:44.921265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.073595Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.073595Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:517fcf2eccfc49d15646eb5789e09b2484d6c1607436d69e7d45ffcac6b11345","observation_id":"2aa31ecd-1b36-4c79-a23a-2fd80ed5d43f","resolution":{"observed_at":"2026-08-07T13:10:45.073595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:57.125092Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding","venue":null,"work_id":"2e91fed1-b4de-4b5b-ae10-9d918075eaee","year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.200203Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:9cc6ab0f4b0734831724718a8e8ca3876723c9909535d508d00fe1d9e88eeb25","observation_id":"d84633e9-bfe1-4859-8de3-ad1ba266b0c6","resolution":{"observed_at":"2026-08-07T13:10:57.285209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.325130Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.325130Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:353104e90a8e3df00a63f1ebd3f4d02e66c4c03be574c44b9560b27c8dfa28e7","observation_id":"7786aaa2-42f6-4983-8025-236172866b37","resolution":{"observed_at":"2026-08-07T13:10:45.325130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.470309Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.470309Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:803752b8288486339eeac543a7f7b096da6a8a19f2eb298882d40fd1e72eb694","observation_id":"c4bdd91e-916d-48b7-8ae6-ba21a585a8d9","resolution":{"observed_at":"2026-08-07T13:10:45.470309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-14T03:57:25.019190Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T13:10:45.635718Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.635718Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:41bf85c0e20e2b6ee940f2bdfe6215e90c99ca252d06c177106f85397dfb0bd5","observation_id":"8f62cfd8-7bdb-4bc1-b40d-e42e352344dc","resolution":{"observed_at":"2026-08-07T13:10:45.635718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T13:10:45.780544Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.780544Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:e06f58a5b5de64dcfddbc8b61e4742fd1e733e3911a76fef799990512d869b84","observation_id":"554e8628-ed79-4325-8914-01eb210ef96d","resolution":{"observed_at":"2026-08-07T13:10:45.780544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T13:10:45.965589Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.965589Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b1ec7f25d174296c6d32e5eea6c1b2c2da41f03e81c39261fd846a975e6dfbee","observation_id":"154b2e67-dfd9-49d3-8247-306637013fb2","resolution":{"observed_at":"2026-08-07T13:10:45.965589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T13:10:46.144299Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.144299Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:886269cc6b615e82acb1b0e724cbe25e794ad876bec3fe9fc127b0d77998f1cd","observation_id":"5065b583-6453-4089-8ddf-b0e1f36b6f9d","resolution":{"observed_at":"2026-08-07T13:10:46.144299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T13:10:46.365557Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.365557Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:963020d186476ed99abb6031272eef0ff0ffc8c06f25a794a4451690d0a87010","observation_id":"3f835619-fbea-477d-a8f5-aa583d881a46","resolution":{"observed_at":"2026-08-07T13:10:46.365557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:56.817158Z","title":"Achild…”},{Scene2:“Legsare…","venue":null,"work_id":"4f3524d4-7ee4-4cbc-a196-90514f074b04","year":2025},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.541780Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:d39088ea01c4f75d3ba85080d181b3c19e4724ed95e927ac994f29475419a367","observation_id":"b9a95e2c-c00f-4580-9b5d-6551957c4539","resolution":{"observed_at":"2026-08-07T13:10:56.948195Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:56.408224Z","title":null,"venue":null,"work_id":"cfbe479b-be26-4c06-8d68-87dcafda18d6","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.784745Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:9ce505153bd6b391ac7603e67420301b0c410aa351b04a28c991629d4640fc7b","observation_id":"6208c882-a1e4-4b0e-bd89-8c07fdcb3b5c","resolution":{"observed_at":"2026-08-07T13:10:56.637066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:56.149034Z","title":"events","venue":null,"work_id":"e33ac817-fe66-48aa-aa46-a771b7d8542c","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:46.969026Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:eb01f6fc95de02fdc1a0d3d62a2da51ead431a01faaa23a856c4585e76d21146","observation_id":"d76ef48b-4255-4107-a1a6-693015df19f4","resolution":{"observed_at":"2026-08-07T13:10:56.298105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:55.897784Z","title":null,"venue":null,"work_id":"09fb556e-d31c-4135-a037-0370a1fdcb36","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.160274Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:69fbe1ee1444d82a9e6922e958f244141e7d4702fca3b201b75d7f9ad13a2da0","observation_id":"db8aad78-2cee-4390-97f6-b7b146a25760","resolution":{"observed_at":"2026-08-07T13:10:56.014666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:55.566335Z","title":null,"venue":null,"work_id":"a13bfe12-e862-4035-ba68-e68b17b88f96","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.341401Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:ca30bc915ba04c4b09372b8a3dad6067d7eef1d436f4a7e3c8303a998314c5a5","observation_id":"9ab6bacb-9e18-42c4-8962-c6b42e505ed6","resolution":{"observed_at":"2026-08-07T13:10:55.716992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:55.243408Z","title":"suitable","venue":null,"work_id":"907ad5fe-6988-438c-8364-8643ddd4b20a","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.485560Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:070785d2dff8ebb49ededcbdfc0540a71cb2e2600c97cb604c7597c112f261f4","observation_id":"f597f086-9003-4464-ac15-afa20cba306b","resolution":{"observed_at":"2026-08-07T13:10:55.431653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:54.951374Z","title":"d e s c r i p t i o n","venue":null,"work_id":"ec7afa64-2491-4924-a955-a8b67720afc0","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.692629Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:73c4db7e7df4dff72963b3ad895ba8fc5a4eebc2e0bd3013811a6b6c129cbff1","observation_id":"92fcad3b-2201-482f-a665-5f0f263ba338","resolution":{"observed_at":"2026-08-07T13:10:55.086036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:54.711901Z","title":null,"venue":null,"work_id":"93ccee62-82c8-4fe5-a5ef-a8ffa6d64f84","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:47.902944Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b2534b35c3a0f250836864a612027e451eb2e263bc40bcb42e5bc45d0ee474b1","observation_id":"65ad7b78-c82f-496e-b895-ac0d179512ba","resolution":{"observed_at":"2026-08-07T13:10:54.826050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:54.310425Z","title":"d e s c r i p t i o n","venue":null,"work_id":"5a1e738b-9302-450c-83bd-0df347d16b6d","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.042558Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:2cec10e14526010cceaea4e59cadd07debbb0a493e1520db9d788ce1ba1bbc79","observation_id":"3dc27cc6-0011-43e3-9455-e1c67fec9fd4","resolution":{"observed_at":"2026-08-07T13:10:54.512731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:53.946983Z","title":"d e s c r i p t i o n","venue":null,"work_id":"140b348e-5121-43a1-86d2-dbeb7ce257bd","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.174609Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:98df508ba9cf1cf0e2894e8f43d47297894448fcd51c29d6caa767ea24c0325a","observation_id":"84b3ed2f-467c-4790-8f1d-79d50c88cff6","resolution":{"observed_at":"2026-08-07T13:10:54.188702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:53.456038Z","title":null,"venue":null,"work_id":"e79d3057-fce3-4e57-aaff-ca0fc890af87","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.281096Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:676b82c4d3ff9d16222fc833097eab4b39d00b5c94d011457fa962a0eda91421","observation_id":"eccaab00-adda-4cac-ae6f-5c2cb4d935ad","resolution":{"observed_at":"2026-08-07T13:10:53.697297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.961912Z","title":null,"venue":null,"work_id":"cccbe394-fd93-4acc-91b9-85c97dafc260","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.488636Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:ef5fea2337cf8099c9b75b748af2b2a1a909b8d31cbc6dc2d6253e6b1e9391f0","observation_id":"1f1cdcd4-1d27-43a9-b28a-efcbd22a09db","resolution":{"observed_at":"2026-08-07T13:10:53.211950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.561826Z","title":null,"venue":null,"work_id":"524d6b7c-8f59-46dd-94ea-4b80c7dc3e1b","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.685909Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:6786d62d11f93e93e7f5c8f6c31a0f5a2a4978514b6b6b1d8600f5ec6c1d69b5","observation_id":"b511f957-3141-4348-bff4-5b1eab709b5e","resolution":{"observed_at":"2026-08-07T13:10:52.783190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.301279Z","title":"C o n c l u s i o n : right","venue":null,"work_id":"ce0c7c65-c5bb-4298-9e5b-163af57fb86b","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:48.873561Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8c3c0ca1ef4f77cc7d420a7424ab25e65c19272bf2af1f283e298d22ba184891","observation_id":"22328854-7e91-457c-ab7c-b0555fe4e041","resolution":{"observed_at":"2026-08-07T13:10:52.398983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:52.103736Z","title":"Question","venue":null,"work_id":"4047b6de-ab0e-47cc-8835-19d822eb4fa3","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.053040Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:3f82fda1df5ccb400d481e44b7dccfc662838647976091389c1adc0f1842ba58","observation_id":"627e4afa-4a32-46f5-b949-8c9971d99f08","resolution":{"observed_at":"2026-08-07T13:10:52.182869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.909877Z","title":"- Ensure only one correct answer and that the r em ai nin g three options are wrong","venue":null,"work_id":"2ac60cab-e7a9-4991-84e1-f18ede839293","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.269402Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5cc134b27ec2967d593a19d06bf0d1f90f56548a2bff6d763d6b6363ce1dc259","observation_id":"ff0e6b85-545b-419d-ab95-d3c6aa46106c","resolution":{"observed_at":"2026-08-07T13:10:52.002985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.763408Z","title":"Question","venue":null,"work_id":"c2b691de-fc8f-4d33-9daa-9547abb238ff","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.416429Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5f035e22b664142635eaa22501c7ff4c0e0be2ff748577e33ba3303e2d42c901","observation_id":"13c7557d-d7c2-4d67-b2ab-c3048e22dcae","resolution":{"observed_at":"2026-08-07T13:10:51.837463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.628127Z","title":"- Ensure only one correct answer and that the r em ai nin g three options are wrong","venue":null,"work_id":"5ae101e2-45f0-4b22-bd2c-b48251fdb1da","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.612554Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:521bd87e9e77fb82e3626d46551ce604ce99ab525896099ff19a835a83223843","observation_id":"0a22f794-bfb4-45da-bb6b-cda04bf24d4c","resolution":{"observed_at":"2026-08-07T13:10:51.690049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.461606Z","title":"Question","venue":null,"work_id":"5f504671-5f5d-4c47-9f48-4285f3e303aa","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.785664Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5b4baad455218b065333251edb22bedeae4d8081d8d0fa09b5ac0e6f7c5590b8","observation_id":"3e9e1026-edaa-4cd2-b433-e990e86b4565","resolution":{"observed_at":"2026-08-07T13:10:51.549366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.281112Z","title":"- Ensure only one correct answer and that the r em ai nin g three options are wrong","venue":null,"work_id":"8e1dfa6d-e3ff-492a-961e-e140c6dadcfa","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:49.909121Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:cf0651141263adadbfc36d6e47107c4d2bd6782dd307fc6ec60d552440a52dd0","observation_id":"02fa0c0c-327e-4877-86c2-325c0418a7f0","resolution":{"observed_at":"2026-08-07T13:10:51.367016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:51.071744Z","title":"Question","venue":null,"work_id":"3cb4cd5d-cc45-4166-8427-ec8291db0386","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:50.061912Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:b317400cd03279faee668b5d46a8c6534d839aba800224a6c26a928fcbd650c8","observation_id":"aaf58cc8-58b2-43d2-b779-18a2023b4d3d","resolution":{"observed_at":"2026-08-07T13:10:51.201914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:50.833768Z","title":"- Answer options should be built upon the scenes after the observed scenes and before the last scene","venue":null,"work_id":"d8f795a8-f277-443a-b62d-e586a014ad07","year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:50.329904Z"},"links":{"citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:8593156af704cee065739a714690788cf73a60c9bc412e40476447a7feb01291","observation_id":"26d5b6dc-02ae-4016-a9b7-aec1ff6e3ed3","resolution":{"observed_at":"2026-08-07T13:10:50.917351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:33:35.736447Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 5 inbound Pith citation observations for arXiv:2505.22457."}