{"as_of":"2026-08-22T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:750eabde93ce34b6aeb0c184cf04b3f8eed4bd4aa69727cc81f1d42fa435133a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:50:21.460707Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.306434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-08-14T11:10:08.135537Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:5f493bac74cefba2fef55ebc45e70558fa74878b6456d23c2d45526a228a1b3c","observation_id":"64afd474-cd84-470f-a8c7-086f8848c8d4","resolution":{"observed_at":"2026-05-17T20:22:35.036418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-11T16:51:15.224560Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10471","last_updated":"2025-03-10T03:35:16Z","snapshot_observed_at":"2026-08-17T17:41:07.728217Z","submitted_at":"2024-12-12T23:39:54Z","title":"VCA: Video Curious Agent for Long Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:51:15.224560Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2412.10471"},"observation_digest":"sha256:3902faab2b20925fb13637ac557b2e7a450f341e9add284f05fe9d17ade8e971","observation_id":"46e6c3fb-224b-45ad-9dca-67673151045b","resolution":{"observed_at":"2026-08-11T16:51:15.224560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-10T22:57:40.076720Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-15T21:07:19.601850Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:40.076720Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2501.00584"},"observation_digest":"sha256:78b3d3c4eccaa86ed6bc31476c7dc8db6d183e21287a9d80f0ef070ea575ef44","observation_id":"8e5744cd-a924-45b2-8ab4-c4eb5b1f5cca","resolution":{"observed_at":"2026-08-10T22:57:40.076720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-09T21:21:45.710426Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19098","last_updated":"2025-05-19T10:18:07Z","snapshot_observed_at":"2026-08-16T13:38:37.801093Z","submitted_at":"2025-01-31T12:45:46Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T21:21:45.710426Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2501.19098"},"observation_digest":"sha256:4946d0c46d6ae42963d313216c1acaff01b0fea166533fd0669059478e688f6a","observation_id":"19a7a086-642e-4a1c-8375-70f6a74947f8","resolution":{"observed_at":"2026-08-09T21:21:45.710426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-16T10:50:21.460707Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17213","last_updated":"2025-04-28T05:05:24Z","snapshot_observed_at":"2026-08-18T13:50:31.935936Z","submitted_at":"2025-04-24T02:54:40Z","title":"MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:21.460707Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2504.17213"},"observation_digest":"sha256:79a284578e5b3dcafd8991a0998cf00086d3c68c820b0fd814e6157f76e8584b","observation_id":"68a5db79-232f-41c0-be4a-2b388ff281c4","resolution":{"observed_at":"2026-08-16T10:50:21.460707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-16T04:10:57.295597Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-21T14:32:09.507483Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.295597Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:4f48706642218bf7c3d18485543de6b8f3ad4d81b3b7af6c3f8c6de76b806649","observation_id":"2942772e-a2f3-4211-b5d8-6c2a222f5199","resolution":{"observed_at":"2026-08-16T04:10:57.295597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-07T06:00:56.930356Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.arXiv preprint arXiv:2308.09126, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-17T10:00:49.433347Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:56.930356Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:c192450fe953e27535dfc4d56501e7c0e1045480e5c3ef1c82301f0e0d4df14c","observation_id":"d3ebb7c6-b8f5-4554-81cc-2595dd0a4c2b","resolution":{"observed_at":"2026-08-07T06:00:56.930356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-07T04:45:00.265342Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09943","last_updated":"2025-06-11T17:10:36Z","snapshot_observed_at":"2026-08-13T03:47:33.871757Z","submitted_at":"2025-06-11T17:10:36Z","title":"CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:00.265342Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2506.09943"},"observation_digest":"sha256:a8e5f7d25b64b00e422804edd39f352d6db72b7c85db041535eeaec6efb7b15c","observation_id":"9e01ba51-5333-48b2-be59-6a13003a0f9b","resolution":{"observed_at":"2026-08-07T04:45:00.265342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-06T20:38:30.134630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-14T07:01:53.180437Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:30.134630Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:4652deacab25f05c891e3745a430cd3a22f7d64ba561f519c0d8690614de4c41","observation_id":"468d22ad-8ab8-4b9f-b59b-9d312cb0db29","resolution":{"observed_at":"2026-08-06T20:38:30.134630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-06T18:10:12.839920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-15T15:00:20.346279Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.839920Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a764cfb1a2a91b45323cef4ccfbd998e6ff67afab7d14048c23d31d22155e0b2","observation_id":"e0001093-1c8d-428c-8368-db9820138888","resolution":{"observed_at":"2026-08-06T18:10:12.839920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-19T22:56:20.379542Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:7d59036811c89d5601a888b3b7dc47bfeb24bbb0b19172359ea1e8138f90ec9a","observation_id":"86434552-e4a1-40e7-b298-5d29ddd11a74","resolution":{"observed_at":"2026-05-16T12:57:53.948203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2603.20180","last_updated":"2026-05-07T09:47:21Z","snapshot_observed_at":"2026-08-16T03:17:55.420304Z","submitted_at":"2026-03-20T17:55:32Z","title":"Adaptive Greedy Frame Selection for Long Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T08:22:24.872665Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2603.20180"},"observation_digest":"sha256:58d0fc94e25b18fecc572d83ab522b4dc55ed5981ab1e7bb88cbdb38c9db8fbf","observation_id":"05cf38b2-0bf8-4475-b41a-9d86e78056f9","resolution":{"observed_at":"2026-05-15T08:25:18.980287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-16T08:18:47.813005Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:25aae75b34314367369c4d99de7d66449e9508a0b864b49141923619dd573edc","observation_id":"e0e18d26-0bf9-486f-b1f2-9c81172d79f5","resolution":{"observed_at":"2026-05-11T01:45:52.094055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2605.06747","last_updated":"2026-05-07T15:21:58Z","snapshot_observed_at":"2026-08-20T05:44:17.418982Z","submitted_at":"2026-05-07T15:21:58Z","title":"HumanNet: Scaling Human-centric Video Learning to One Million Hours","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T00:51:08.414394Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2605.06747"},"observation_digest":"sha256:e45cd8c56a1d408b20a0c7d65eb2e3b8861313123346f679b6db05cd1a40c973","observation_id":"c04ffac2-679e-424d-a546-0c9ed249b1ff","resolution":{"observed_at":"2026-05-11T05:10:54.191355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2605.19559","last_updated":"2026-05-19T09:02:20Z","snapshot_observed_at":"2026-08-16T01:19:28.511820Z","submitted_at":"2026-05-19T09:02:20Z","title":"EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:53:05.450946Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2605.19559"},"observation_digest":"sha256:9d87691261c583a61b3e5aa003e897d3b745c5acf4c587d17870978e52ba6d5f","observation_id":"f0cc8be1-9168-4401-b590-c2240d6e1ad1","resolution":{"observed_at":"2026-05-20T05:53:22.271439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2605.24456","last_updated":"2026-05-26T08:53:56Z","snapshot_observed_at":"2026-07-06T23:34:33.493637Z","submitted_at":"2026-05-23T08:07:45Z","title":"EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T13:28:43.538541Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2605.24456"},"observation_digest":"sha256:00fd14088878311bf12d35de68ca326cd2e2c0baa73d1ac3a00c9c9267577b44","observation_id":"ccad6fc8-7167-48d0-a6bc-5f44830d7c13","resolution":{"observed_at":"2026-06-30T13:34:40.524149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2605.30673","last_updated":"2026-07-06T14:01:36Z","snapshot_observed_at":"2026-08-15T11:54:02.006644Z","submitted_at":"2026-05-29T00:06:54Z","title":"TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:43.712391Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2605.30673"},"observation_digest":"sha256:8e4cce4d4c14beabbd5702adfd39784c0cacd919423167d139338848f930a25f","observation_id":"dc68e372-e42d-4d31-9ffa-227accf43bb7","resolution":{"observed_at":"2026-06-28T23:12:46.641053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.00616","last_updated":"2026-06-29T17:52:29Z","snapshot_observed_at":"2026-08-12T14:25:47.666077Z","submitted_at":"2026-05-30T08:33:55Z","title":"Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T19:11:28.937135Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.00616"},"observation_digest":"sha256:4889f7f53cca3d0a9d49c6afa0759e92ad30d0201b135a32065c4988e90379ec","observation_id":"09494012-2fb3-4efb-8910-3abc33393d82","resolution":{"observed_at":"2026-06-28T19:12:34.434642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.00616","last_updated":"2026-06-29T17:52:29Z","snapshot_observed_at":"2026-08-12T14:25:47.666077Z","submitted_at":"2026-05-30T08:33:55Z","title":"Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T11:37:50.291543Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.00616"},"observation_digest":"sha256:5108b9e29c88f704ab93c1724ee833c1928cc5f7b838537163c12cd8b5e826bd","observation_id":"b38608ab-01fb-4bc1-b61a-febc772f53a0","resolution":{"observed_at":"2026-06-30T11:44:38.506790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.00825","last_updated":"2026-05-30T17:53:10Z","snapshot_observed_at":"2026-08-17T21:14:38.534882Z","submitted_at":"2026-05-30T17:53:10Z","title":"SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T19:00:20.891691Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.00825"},"observation_digest":"sha256:800e02053bbbbb7553a31a7b764f3b5e99f07da8b1010f6e81196725aa389d20","observation_id":"a35d243a-9411-42c6-a6eb-2415516408d5","resolution":{"observed_at":"2026-06-28T19:02:34.145726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.04773","last_updated":"2026-06-03T11:53:57Z","snapshot_observed_at":"2026-08-07T06:09:02.341844Z","submitted_at":"2026-06-03T11:53:57Z","title":"NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T06:55:22.332372Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.04773"},"observation_digest":"sha256:e615e75cccd5a452bc8eb1a94b91942ee189c43950d8f2dd3f41ac7baeea7f8b","observation_id":"b33479a2-f95b-47b1-bb50-245f20f7b627","resolution":{"observed_at":"2026-07-02T07:26:46.156168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-08-17T19:24:43.936240Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:9dcc1a4ea65e4bbe112cca20ca08dd1b5072f116a22de86b7b3d2d592a7fce43","observation_id":"2ceec0df-85e7-4ce4-8fab-9895482f6318","resolution":{"observed_at":"2026-07-01T22:26:17.890023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.24422","last_updated":"2026-06-23T10:59:25Z","snapshot_observed_at":"2026-08-12T17:53:51.025868Z","submitted_at":"2026-06-23T10:59:25Z","title":"EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T00:26:33.306128Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.24422"},"observation_digest":"sha256:56221afb036ad8d15586304f1737ab6a1f66272143321f052e6970630c042f6d","observation_id":"4f2851b0-9617-47dc-92f0-6fb59e21afad","resolution":{"observed_at":"2026-07-04T16:39:57.307946Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.30220","last_updated":"2026-06-29T12:33:15Z","snapshot_observed_at":"2026-08-16T08:21:59.637725Z","submitted_at":"2026-06-29T12:33:15Z","title":"From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:14:11.109840Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.30220"},"observation_digest":"sha256:a02e1b5da48bfde2919c6837ed02a7367781eb7d0cab77d353a16a19e4b61649","observation_id":"365b3d41-34c0-4c51-bf09-e04b99c0b6c3","resolution":{"observed_at":"2026-06-30T06:14:18.581710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-02T02:42:47.589671Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14252","last_updated":"2026-07-15T18:12:28Z","snapshot_observed_at":"2026-08-17T06:03:14.741643Z","submitted_at":"2026-07-15T18:12:28Z","title":"MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T02:42:47.589671Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2607.14252"},"observation_digest":"sha256:9c10ed62173450b4fe7ebf196496365d23d62d8b9086da351f5bd26de91ec42f","observation_id":"dbf7d4f3-fae6-4381-8f1b-f91477ad19b1","resolution":{"observed_at":"2026-08-02T02:42:47.589671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-04T03:21:46.535881Z","title":"arXiv:2308.09126","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28312","last_updated":"2026-08-01T16:00:11Z","snapshot_observed_at":"2026-08-21T19:05:25.712209Z","submitted_at":"2026-07-30T14:47:00Z","title":"ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T03:21:46.535881Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2607.28312"},"observation_digest":"sha256:4cef0d6620a8600359e235fc12cf6951dd7a4426cd8af56a791112c0eda3cac2","observation_id":"b7e99be9-fe47-41e4-a095-7abe1408cc75","resolution":{"observed_at":"2026-08-04T03:21:46.535881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-04T23:46:51.588231Z","title":"Advances in Neural Information Processing Systems (NeurIPS), Datasets and Benchmarks Track , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-15T14:21:17.838676Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.588231Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:ef3de4825d8530bc4c9f5df83a48597fc33e9160fe13498c8a7c36b085235963","observation_id":"6e0885d0-099b-498c-9184-bfdcca6e8f75","resolution":{"observed_at":"2026-08-04T23:46:51.588231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.09126/citation-record","integrity":"/paper/2308.09126/integrity","json":"/paper/2308.09126/citation-record.json","paper":"/paper/2308.09126"},"outbound":[],"paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T04:03:13.105419Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2308.09126."}