{"as_of":"2026-08-15T00:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:971bb6c3bab1b836b96d1213fd9228aeb605bda5d13c5214973d579866bf91de","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:10:14.919272Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09068/citation-record","integrity":"/paper/2507.09068/integrity","json":"/paper/2507.09068/citation-record.json","paper":"/paper/2507.09068"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-14T11:37:12.426263Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2502.07811","doi":"10.48550/arxiv.2502.07811","metadata_source":"pith","pith_arxiv_id":"2502.07811","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","venue":"cs.CV","work_id":"86a6a47a-f7f0-4fda-9117-95bc376dc0bd","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.061419Z"},"links":{"cited_paper":"/paper/2502.07811","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:121a5193885cb07dc319ece1e70ba855c06b9ef1e2514d5e9a292c80d58a5405","observation_id":"ff0a1ede-3856-4a74-ad1e-e3544cd0a8b4","resolution":{"observed_at":"2026-08-06T18:10:16.731929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:18.233500Z","title":null,"venue":null,"work_id":"e19ff185-08e7-4d75-b66b-29ecd8f1f848","year":2011},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.114356Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:feb3a9e8949fe74118d6580a22cd043f5ce650aef90d3c414a35afe0169908df","observation_id":"c25e915d-4ba9-493f-847b-51365e8f7fda","resolution":{"observed_at":"2026-08-06T18:10:18.299149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04998","last_updated":"2024-11-07T18:59:16Z","snapshot_observed_at":"2026-08-12T22:05:24.291280Z","submitted_at":"2024-11-07T18:59:16Z","title":"HourVideo: 1-Hour Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04998","snapshot_observed_at":"2026-08-06T18:09:18.211447Z","title":"Hadzic, Taran Kota, Jimming He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, and Li Fei-Fei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.211447Z"},"links":{"cited_paper":"/paper/2411.04998","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e400bee3d12396fb12532edd757a9ae266241706d0b3daaf574ef251014f728d","observation_id":"01bcc5ab-e0c7-4408-a60e-48774759a8fe","resolution":{"observed_at":"2026-08-06T18:09:18.211447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T18:09:18.313230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.313230Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:216787689d7533d3a1a724374ee80cca2c8c144ef21fba092dbbbc0717581c53","observation_id":"339e7bb3-dc67-4a6f-8af4-aff75a9dfa3c","resolution":{"observed_at":"2026-08-06T18:09:18.313230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-14T11:12:53.803525Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-06T18:09:18.568750Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.568750Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:96127714a56434cdcdec8f2f1b4917de5af4c7b5c7f30c1ca90f3895c38096a6","observation_id":"809b2dcf-8bb2-479b-964a-3488ccdb6144","resolution":{"observed_at":"2026-08-06T18:09:18.568750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-13T14:51:05.772020Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-08-06T18:09:18.954541Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.954541Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:482e0c4f5749a016dd76ede08ece03e130b9add526e33439599f9a922ed36067","observation_id":"8d053b18-1eb2-430a-9e88-2a6c782636e8","resolution":{"observed_at":"2026-08-06T18:09:18.954541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00937","last_updated":"2023-12-01T21:34:10Z","snapshot_observed_at":"2026-08-13T05:12:08.570813Z","submitted_at":"2023-12-01T21:34:10Z","title":"Zero-Shot Video Question Answering with Procedural Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00937","snapshot_observed_at":"2026-08-06T18:09:19.409539Z","title":"Kitani, and László A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:19.409539Z"},"links":{"cited_paper":"/paper/2312.00937","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:43fb152763549f8d55a4fa6513ae4c6fc58a2953423d3ed5972520d69abfd615","observation_id":"dbef02ca-88ff-488e-a914-02db772cb241","resolution":{"observed_at":"2026-08-06T18:09:19.409539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-06T18:10:11.725676Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.725676Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a4119e1d8a3467553a968a16b37d9f8c2aae513744f7c1dd0675067f222008e4","observation_id":"68494767-b952-4b9b-bba1-bbddf06ed232","resolution":{"observed_at":"2026-08-06T18:10:11.725676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17823","last_updated":"2024-07-18T08:56:11Z","snapshot_observed_at":"2026-08-13T00:44:34.550191Z","submitted_at":"2024-03-26T16:04:19Z","title":"Efficient Image Pre-Training with Siamese Cropped Masked Autoencoders","version":2},"cited_work":{"arxiv_id":"2403.17823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17823","snapshot_observed_at":"2026-08-06T18:10:17.107296Z","title":"Efficient Image Pre-Training with Siamese Cropped Masked Autoencoders","venue":"cs.CV","work_id":"1e1134ce-965f-497a-90e4-7b5e02f2c250","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.854309Z"},"links":{"cited_paper":"/paper/2403.17823","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:487427abbaf2b3f55ef0ba2df91b806fb3d519bf815d8e862875bfed10d69aff","observation_id":"545305b2-f2bb-4383-9be8-639125a12ebf","resolution":{"observed_at":"2026-08-06T18:10:17.212457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:18.071567Z","title":null,"venue":null,"work_id":"272bf45e-ebb2-436b-a73c-48daf99c3989","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.899351Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:17134dc3770c97e4d3abe3b1065b1c2dcd8b4a17a42f150223603c402599b0c7","observation_id":"316ad4f0-026d-4451-84aa-0b1e8874df9e","resolution":{"observed_at":"2026-08-06T18:10:18.130805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T18:10:12.056934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.056934Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:fa3c75c9b0942094b1462d4612711e6202b197b0a34f00b370f3e3f4251bd528","observation_id":"276abd28-1608-4fa1-8d37-0830654d553a","resolution":{"observed_at":"2026-08-06T18:10:12.056934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16244","last_updated":"2024-04-28T18:28:33Z","snapshot_observed_at":"2026-08-13T00:22:42.339818Z","submitted_at":"2024-04-24T23:18:46Z","title":"The Ethics of Advanced AI Assistants","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16244","snapshot_observed_at":"2026-08-06T18:10:12.125589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.125589Z"},"links":{"cited_paper":"/paper/2404.16244","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:12b8174b32c60968edf75e3a686b0a49d72f175d1a7073182ef83975b02fbf28","observation_id":"4cbccd92-ffbe-4212-98e0-67fa7f83e1a5","resolution":{"observed_at":"2026-08-06T18:10:12.125589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14344","last_updated":"2023-05-23T17:59:46Z","snapshot_observed_at":"2026-08-13T11:35:15.787179Z","submitted_at":"2023-05-23T17:59:46Z","title":"Siamese Masked Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14344","snapshot_observed_at":"2026-08-06T18:10:12.195376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.195376Z"},"links":{"cited_paper":"/paper/2305.14344","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:c2505a24cf456a2c0363ccfda5b025d7ba2973503e50a18715fc508c1e5bbc79","observation_id":"963c17ec-82c8-4343-91e9-d85d06aa17ca","resolution":{"observed_at":"2026-08-06T18:10:12.195376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-14T09:25:42.723726Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-06T18:10:12.307299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.307299Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:9f1fea70da6b0facf462d46b0838af3056bbc870fe859129a39fae76480547b9","observation_id":"12718065-f4c4-4ac8-9980-1d22368d0953","resolution":{"observed_at":"2026-08-06T18:10:12.307299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07398","last_updated":"2024-08-08T19:48:10Z","snapshot_observed_at":"2026-08-12T23:45:24.860749Z","submitted_at":"2024-06-11T16:05:15Z","title":"Visual Representation Learning with Stochastic Frame Prediction","version":2},"cited_work":{"arxiv_id":"2406.07398","doi":"10.48550/arxiv.2406.07398","metadata_source":"pith","pith_arxiv_id":"2406.07398","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Visual Representation Learning with Stochastic Frame Prediction","venue":"cs.CV","work_id":"6087f764-06d6-4a4f-a446-8b01ff444dbd","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.401921Z"},"links":{"cited_paper":"/paper/2406.07398","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e8899c205fd5dfd4de4203310e0c96de8def550c8dd329f7808a0cdae10a6833","observation_id":"9110064f-0fc6-4002-a20d-c5fe49e3a397","resolution":{"observed_at":"2026-08-06T18:10:16.421305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T18:10:12.472087Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.472087Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:991f99ad8181fb94030fcc510f115cd127eea5cfdfb9cc825f59d1e7081950f0","observation_id":"2b5d77ea-50d5-4d97-8f44-c7bd15d9693d","resolution":{"observed_at":"2026-08-06T18:10:12.472087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01681","last_updated":"2025-01-03T07:57:38Z","snapshot_observed_at":"2026-08-14T00:16:34.515071Z","submitted_at":"2025-01-03T07:57:38Z","title":"SNeRV: Spectra-preserving Neural Representation for Video","version":1},"cited_work":{"arxiv_id":"2501.01681","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01681","snapshot_observed_at":"2026-08-06T18:10:16.885731Z","title":"SNeRV: Spectra-preserving Neural Representation for Video","venue":"eess.IV","work_id":"cbaafd65-e1ca-489c-813c-db992faeede7","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.519667Z"},"links":{"cited_paper":"/paper/2501.01681","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:2bf17fa12de03ff8b516f418335fc73311140383f5aa08dc392cc13e4a0163f6","observation_id":"0b728617-5100-420c-887d-8c52582f04f6","resolution":{"observed_at":"2026-08-06T18:10:16.964469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.936816Z","title":null,"venue":null,"work_id":"483d3cef-fb68-4c79-a0a0-94b22e429917","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.559183Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:635ad7b8991ba256bc7143492074de6095fb642b60f285bbda90df9d52a570f8","observation_id":"fb2b3eb7-0cd3-4be0-bd16-9ca2d015fd81","resolution":{"observed_at":"2026-08-06T18:10:17.987768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.20444","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"ArXiv.org","work_id":"5696f847-3d90-481a-9434-01ddb548f82d","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.643858Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:bcb1b6606631a8a6442d2dc12e7f5a90c01631ed3fd7845c21d0008aaf009834","observation_id":"7b403170-dbfe-452a-bdbd-19522ed26d68","resolution":{"observed_at":"2026-08-06T18:10:16.232019Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04625","last_updated":"2025-03-07T18:13:22Z","snapshot_observed_at":"2026-08-12T12:55:25.017700Z","submitted_at":"2025-03-06T17:11:51Z","title":"START: Self-taught Reasoner with Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04625","snapshot_observed_at":"2026-08-06T18:10:12.598324Z","title":"doi:10.48550/arXiv.2503.04625 arXiv:2503.04625 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.598324Z"},"links":{"cited_paper":"/paper/2503.04625","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:541355c908dcf496f32aa5e5329ea51480cf62cc741eec993cfe16d1b4f88267","observation_id":"43e3fa0f-361d-4cba-9e31-bc1fd9e80412","resolution":{"observed_at":"2026-08-06T18:10:12.598324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T18:10:12.714751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.714751Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:c0a50a1f66d72071326a2f0e1da0bf28ae3b15daad0b9242ce659cf886a35b67","observation_id":"97ac225c-a44b-48e7-b367-d1e266ecfdf5","resolution":{"observed_at":"2026-08-06T18:10:12.714751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-08-14T11:10:08.135537Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-06T18:10:12.662954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.662954Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:485ff710427f806d4b2c68e2e5a9cfb4ebc779f4f7cff49ed8f4ad7c9625dafd","observation_id":"cc6d9d5e-c795-46dd-b38d-5aa40d4a9983","resolution":{"observed_at":"2026-08-06T18:10:12.662954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-07T16:41:53.661756Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-06T18:10:12.773039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.773039Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:094eb2499552c12447af9d20487922cf4101993b0618594ce65d890400058ea2","observation_id":"3633c010-534b-47ba-b99c-22c9cd1f6f03","resolution":{"observed_at":"2026-08-06T18:10:12.773039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T18:10:12.748486Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.748486Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:c0d1857c4332deae72f36120f4d50f4bf82b874f1645edd4b4651fcbeb545271","observation_id":"448a4907-dd0e-4419-9ed5-fba4759143ce","resolution":{"observed_at":"2026-08-06T18:10:12.748486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-13T10:32:52.048462Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-06T18:10:12.839920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.839920Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:ed1d40c9e94f9c9b2a097a6aa5bec955663af0d01076bddc69003a69afabbf46","observation_id":"e0001093-1c8d-428c-8368-db9820138888","resolution":{"observed_at":"2026-08-06T18:10:12.839920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:12.786822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.786822Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:0ff4ea624c328b572f5f9082aec77e20bb6671ebe3f1e4bb30f0c7dca7f767df","observation_id":"6dcac48e-b7e6-4df2-9834-febd2b9658ff","resolution":{"observed_at":"2026-08-06T18:10:12.786822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T18:10:12.942821Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.942821Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:1d636a01736cde7bfdc21193e01734978bb921fc640af924b91bcc93bf2684ef","observation_id":"01d0693d-1a66-4237-85d4-664f63fa52b0","resolution":{"observed_at":"2026-08-06T18:10:12.942821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.762167Z","title":null,"venue":null,"work_id":"5a92e728-566a-4aa3-be11-f19e63316929","year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.877764Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:1ab564cc8d49f14e39bc798b2d71710c0818ebe2008e05cd81fdde0cf1fcdb22","observation_id":"20a4e7fb-271f-4a54-b77d-5c48378e0b2e","resolution":{"observed_at":"2026-08-06T18:10:17.807895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-14T14:43:02.885779Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-06T18:10:13.072860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.072860Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:55771a48e27f8970c720c8f21a311f85daf8ba52e55143bb62e7cfac10f85e5d","observation_id":"af469056-2597-4916-802c-3e9a4e6eb44a","resolution":{"observed_at":"2026-08-06T18:10:13.072860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-08-13T20:04:30.114287Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-06T18:10:13.022336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.022336Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:efc16d22a10532090974777b6dcb4352303f9c2663768f3257c34d6b2e67dc5a","observation_id":"e76d6843-4626-47ad-ba97-c6f7c48102fe","resolution":{"observed_at":"2026-08-06T18:10:13.022336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T18:10:13.140709Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.140709Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:bef4ea25ee4643412b7532c5fd0722e27e55373dadcb353489bd5cbee649c4d2","observation_id":"e32d3cd9-dbef-4bfe-8da5-bd1a7f618ab4","resolution":{"observed_at":"2026-08-06T18:10:13.140709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11369","last_updated":"2024-07-18T08:27:05Z","snapshot_observed_at":"2026-08-14T18:28:10.576788Z","submitted_at":"2021-09-23T13:30:18Z","title":"Recent Advances of Continual Learning in Computer Vision: An Overview","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11369","snapshot_observed_at":"2026-08-06T18:10:13.104601Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.104601Z"},"links":{"cited_paper":"/paper/2109.11369","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b99d877448894d9616a97569aae9bbf383e42da67ad951330b03eaa41d72f3a2","observation_id":"2aaa3216-7106-47ce-b2e1-40f190617bbc","resolution":{"observed_at":"2026-08-06T18:10:13.104601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-06T18:10:13.260398Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.260398Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:fa35a8b43e1dc2841d923e3208615c03d92d4f2ebcf5db00c48290212a97e8ba","observation_id":"ea010615-2ce1-47d8-9be6-4ea8823abe73","resolution":{"observed_at":"2026-08-06T18:10:13.260398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19098","last_updated":"2025-05-19T10:18:07Z","snapshot_observed_at":"2026-08-10T11:57:26.754523Z","submitted_at":"2025-01-31T12:45:46Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","version":2},"cited_work":{"arxiv_id":"2501.19098","doi":"10.48550/arxiv.2501.19098","metadata_source":"pith","pith_arxiv_id":"2501.19098","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","venue":"cs.CV","work_id":"35d85e1a-9287-48e0-9d2a-63663a8f6f28","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.200174Z"},"links":{"cited_paper":"/paper/2501.19098","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b289a3d3f133d0f6c4249c66870a369d712a230e7d5b052ae0af94677dce8ae6","observation_id":"edc308c6-cf1f-431d-b0d1-b121878aafd8","resolution":{"observed_at":"2026-08-06T18:10:15.807015Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.630980Z","title":null,"venue":null,"work_id":"80ad576e-9ec6-4da5-9173-cba0a6ac27c8","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.328713Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e9e81d5f7b5774c0095a8188fd4c767e47647396faab9d3c39a46595bedeec43","observation_id":"e76d195d-b50d-4df2-969f-288c3370d330","resolution":{"observed_at":"2026-08-06T18:10:17.698230Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-12T22:40:07.009932Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T18:10:13.296306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.296306Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b909a5a5a8caabaa9f5ae1a5e6d8eaebc48f12f5699b10b1e5781e30eed65792","observation_id":"c2df738d-2eb6-4bef-b7fd-a788422984d2","resolution":{"observed_at":"2026-08-06T18:10:13.296306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:10:13.446720Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.446720Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:6355ace9ffe6c55da2fc5719659fcfbd9855bb5cff8ad9ab83121d299b52b4f7","observation_id":"6daaacba-cd5e-4c86-b121-09b740e1fcb6","resolution":{"observed_at":"2026-08-06T18:10:13.446720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-13T10:44:25.209833Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T18:10:13.357356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.357356Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b49e996a0f4c2b54586bbb227f80d7f88b9b58d596ac024411e36344c36019b3","observation_id":"102ccd94-8ead-4ada-9021-3f44632e9396","resolution":{"observed_at":"2026-08-06T18:10:13.357356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T18:10:13.651494Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.651494Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8987e4bf6ce2361f9b15e8e4e792e3a04745bee28e6939bb5dc1da6feabb510d","observation_id":"1d59b233-d2bb-4843-81a8-9b4565f0816f","resolution":{"observed_at":"2026-08-06T18:10:13.651494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T18:10:13.574181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.574181Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:cb235e95a501e18218c20eaa861dce5d034372c1ce019374ee1faa720106e9df","observation_id":"8627080a-8146-4fd5-893f-d0b40c9a5e1c","resolution":{"observed_at":"2026-08-06T18:10:13.574181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00487","last_updated":"2024-02-06T09:12:09Z","snapshot_observed_at":"2026-08-13T12:54:28.079073Z","submitted_at":"2023-01-31T11:34:56Z","title":"A Comprehensive Survey of Continual Learning: Theory, Method and Application","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00487","snapshot_observed_at":"2026-08-06T18:10:13.775787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.775787Z"},"links":{"cited_paper":"/paper/2302.00487","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:9a8ff24328a2886cc627ec5e7282122ab6cdb26a3560f46f0bbf470ae62f4840","observation_id":"5c8a1017-73f4-4f2c-9e4d-a780ab36782d","resolution":{"observed_at":"2026-08-06T18:10:13.775787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16727","last_updated":"2023-04-18T11:46:41Z","snapshot_observed_at":"2026-08-13T12:14:01.556405Z","submitted_at":"2023-03-29T14:28:41Z","title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16727","snapshot_observed_at":"2026-08-06T18:10:13.711528Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.711528Z"},"links":{"cited_paper":"/paper/2303.16727","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:d295c11383d33566016f93f45c69ef80d818040d3d4a4d15a3031089ce537f26","observation_id":"06bfa572-b497-4805-9795-6453d48c3512","resolution":{"observed_at":"2026-08-06T18:10:13.711528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":"2412.17726","doi":"10.48550/arxiv.2412.17726","metadata_source":"pith","pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","venue":"cs.CV","work_id":"b2d90e1c-0508-4014-b22e-dff5270cd25d","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.101777Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:53342f78024ac7785973ec7d8e480e62eb70afc4055177595f74cd97821dc3aa","observation_id":"ef828168-849f-4259-8d45-f7f2490571e5","resolution":{"observed_at":"2026-08-06T18:10:15.572551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.449839Z","title":null,"venue":null,"work_id":"d5150357-f373-4ed8-bdaf-94f0d3b81539","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.937532Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:c7393d1435a7d511d63684ddddce67c9a97b4cfa81e803a5cf60e0859b669387","observation_id":"a69f610b-c659-49d6-9892-4f1bf7f702e1","resolution":{"observed_at":"2026-08-06T18:10:17.529367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-13T06:46:27.328035Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T18:10:14.257348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.257348Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:5b61a89c79901e18c9b07bd0cbe4d12346999d596a3f0938d112dc1cefca7fa2","observation_id":"f519b7f8-72c3-4347-acda-48ca2a008599","resolution":{"observed_at":"2026-08-06T18:10:14.257348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03384","last_updated":"2024-07-20T07:17:00Z","snapshot_observed_at":"2026-08-13T00:37:48.294859Z","submitted_at":"2024-04-04T11:33:29Z","title":"LongVLM: Efficient Long Video Understanding via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03384","snapshot_observed_at":"2026-08-06T18:10:14.298291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.298291Z"},"links":{"cited_paper":"/paper/2404.03384","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:04323c264f016071da47e2cfeb9099964f245e1b20524001b360907cf3e9700a","observation_id":"a30160aa-9053-40af-9c42-bef00968d3a7","resolution":{"observed_at":"2026-08-06T18:10:14.298291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-13T21:52:29.854534Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-06T18:10:14.223529Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.223529Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:1abc98766ee8ba0892632fd1dbafcd95246136ecf4d97224849f2a3eb97bcf77","observation_id":"5d65b882-b812-4eb2-9817-d7922d9a8c0b","resolution":{"observed_at":"2026-08-06T18:10:14.223529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-08-12T17:37:05.160293Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-06T18:10:14.365798Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.365798Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:874191ef6b381f1a1dd499328dad5ee61b9e347ad847a9fc870e6b700880f6fa","observation_id":"88a9e838-e338-44d7-b0b5-2cabd1433fbc","resolution":{"observed_at":"2026-08-06T18:10:14.365798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-13T13:30:15.151225Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05037","snapshot_observed_at":"2026-08-06T18:10:14.416661Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.416661Z"},"links":{"cited_paper":"/paper/2501.05037","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:946d0943aca3feda46988aa25971d0a325658cf43d4f5644f14f21148fd0abe5","observation_id":"aea3764e-83dd-40b8-9999-1eb2fca7070d","resolution":{"observed_at":"2026-08-06T18:10:14.416661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T18:10:14.340618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.340618Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a254a1e2f1821a70f68c2ff89c6be1e32d77061adf322f939ddf3d1de4286e1f","observation_id":"b6143b35-bfaa-484d-9084-4430ec886d4b","resolution":{"observed_at":"2026-08-06T18:10:14.340618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05199","last_updated":"2023-04-05T02:32:59Z","snapshot_observed_at":"2026-08-14T00:17:59.377084Z","submitted_at":"2022-12-10T04:26:32Z","title":"MAGVIT: Masked Generative Video Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05199","snapshot_observed_at":"2026-08-06T18:10:14.507734Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.507734Z"},"links":{"cited_paper":"/paper/2212.05199","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8d2a8418006c09e64c823b0bb3917a21e5662caf3e34e164a247ef53fbc2ed47","observation_id":"9dda5626-d89f-474a-92d8-7620a5c62f59","resolution":{"observed_at":"2026-08-06T18:10:14.507734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T18:10:14.568887Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.568887Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:18abeda349aea1eb40105b7b98826ac8ae744a1a73dc67c01b5ac84c4872596c","observation_id":"a4883221-886c-418b-9b68-445e2b4784e5","resolution":{"observed_at":"2026-08-06T18:10:14.568887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.03803","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"ArXiv.org","work_id":"93a8c559-d8d9-4661-82f0-90b79e33046d","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.459822Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:81aa0d7369637400e7c1e111b9c6f74e7c3f0eb6d52170c1da758591c732181a","observation_id":"5ab42a16-8fdb-4d71-84eb-02b6ab549f18","resolution":{"observed_at":"2026-08-06T18:10:15.381307Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.18079","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"arXiv (Cornell University)","work_id":"26456078-907a-40f9-8dde-faf4ae630fa7","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.678140Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:64d98af431bcfea72e02a62294f9c893c244e208c5d75428ab957c42edde8b7e","observation_id":"ef731b3e-8c43-42d9-aa5e-109c6274611b","resolution":{"observed_at":"2026-08-06T18:10:15.203453Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.303747Z","title":"Gundavarapu, Liangzhe Yuan, Hao Zhou, Shen Yan, Jennifer J","venue":null,"work_id":"4437474d-322e-432b-8e46-d7a9aeead42e","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.711077Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a587cbd9728c09142eaf813340dbf0e22ffdcbd5c1a3518715e503d8bfeffe82","observation_id":"0c444863-559e-43e1-8eb9-3f9de9561d65","resolution":{"observed_at":"2026-08-06T18:10:17.373787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-06T18:10:14.635404Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.635404Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:06bf0ae22f42b1168a1b5835f5562d7cb45e395fa8b248357fa23e44793f108b","observation_id":"631dce2d-c1ed-46e3-a663-7fb3e379b154","resolution":{"observed_at":"2026-08-06T18:10:14.635404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06391","last_updated":"2024-06-10T15:46:25Z","snapshot_observed_at":"2026-08-12T23:46:21.566927Z","submitted_at":"2024-06-10T15:46:25Z","title":"Towards Lifelong Learning of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06391","snapshot_observed_at":"2026-08-06T18:10:14.841489Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.841489Z"},"links":{"cited_paper":"/paper/2406.06391","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:556ce7b8e069a0895e2728158061f5aa298566e8c7f11657fa5d7805936de01c","observation_id":"bc707462-8bba-42d4-b63e-912ab0c3dfc9","resolution":{"observed_at":"2026-08-06T18:10:14.841489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T18:10:14.864857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.864857Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:dd0e9822421099e0632e151d0dfe5bb595d12fddab12a60011aa0a23b79d6569","observation_id":"12c78463-a446-463e-8f21-9ae51e99a337","resolution":{"observed_at":"2026-08-06T18:10:14.864857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13217","last_updated":"2025-06-07T01:16:44Z","snapshot_observed_at":"2026-08-13T10:27:04.936433Z","submitted_at":"2024-02-20T18:29:49Z","title":"VideoPrism: A Foundational Visual Encoder for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13217","snapshot_observed_at":"2026-08-06T18:10:14.749813Z","title":"doi:10.48550/arXiv.2402.13217 arXiv:2402.13217 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.749813Z"},"links":{"cited_paper":"/paper/2402.13217","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:36dc5cffbb6544aca4ef2221b9a6193ed70684cd7bb7488c194e57314279fb37","observation_id":"398801a5-873c-4169-abf0-73e544e5bb62","resolution":{"observed_at":"2026-08-06T18:10:14.749813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-12T23:43:20.234350Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T18:10:14.777464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.777464Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:c574d046ad98ba1873b1eb7785ffb13626f9b4c7d944cdee4b66d500454b53f2","observation_id":"5da26043-a850-4fdd-8944-8fc06fdf7b6a","resolution":{"observed_at":"2026-08-06T18:10:14.777464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:14.887539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.887539Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e70fef2614a87de62bc63b1eee563af4b9dffd87be518af996e1fbc4d32a6266","observation_id":"168f0a8e-2993-48df-b4f0-266fb42fca75","resolution":{"observed_at":"2026-08-06T18:10:14.887539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18938","last_updated":"2024-12-03T03:56:52Z","snapshot_observed_at":"2026-08-12T22:35:51.520563Z","submitted_at":"2024-09-27T17:38:36Z","title":"From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18938","snapshot_observed_at":"2026-08-06T18:10:14.919272Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.919272Z"},"links":{"cited_paper":"/paper/2409.18938","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:697623c35d3f1393241e48ca2d9d2bc965f3575e01871859923a35fd6aa4480d","observation_id":"ff6bf875-6dfb-403e-aa65-9bd3504869d2","resolution":{"observed_at":"2026-08-06T18:10:14.919272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-06T18:10:13.986726Z","title":"doi:10.48550/arXiv.2406.08035 arXiv:2406.08035 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.986726Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8a42e43c9b1e4e04255680830040824a21250e0077ac69815b053122627b37df","observation_id":"004a05d9-6451-40e2-afb9-1e60ec5aa9fb","resolution":{"observed_at":"2026-08-06T18:10:13.986726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T18:10:11.970598Z","title":"doi:10.48550/arXiv.2503.21776 arXiv:2503.21776 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.970598Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:93330f532e5f825e0a2b6bb4e0f3d7f96240c62810f6fe9073a4a3471747702e","observation_id":"5dfc5ac4-c02b-4cfa-9645-4613c33f3a71","resolution":{"observed_at":"2026-08-06T18:10:11.970598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":54,"verified_exact":8,"verified_fuzzy":1},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2507.09068."}