{"as_of":"2026-08-09T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc1e3f806cc0e40c7d5b867e25993cd51817072e63749e7c62bf3cbf7d1da3cf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:07.794518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.033728Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:5b02daf6bd1c51cf2d599447fed4f953a769a1c62e0290192b4de47483e1f5cd","observation_id":"74c5ed68-2940-4fd2-9e99-9bb5617b6b00","resolution":{"observed_at":"2026-05-15T20:21:58.021092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:ca78dea6282f55ca2d620349a422622f7546988d3a24a51f4fa6bb62b0209600","observation_id":"708ac9fc-961d-46f0-b59a-461ad3e71b9f","resolution":{"observed_at":"2026-05-14T19:55:26.439473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:c755b311acbd15497b497296dfe622192525d8d282d5c27fedfc6387597042b9","observation_id":"a97ff8ec-0d4b-486d-9398-4b33d2e93a95","resolution":{"observed_at":"2026-05-11T02:44:53.638107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:3f9385fdf7e2dafba0c34a0b34610c411745f88cf4a24b9c40e605df3b49d3be","observation_id":"2418df75-a193-48f6-88f8-3fdb91d97860","resolution":{"observed_at":"2026-05-19T11:55:30.104117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:c869c71dfc9f49eeea91f5eccf5b3a45393e5de1ea1eb1bfb6afb6b2f3892caf","observation_id":"185a7090-b23a-4513-a028-018679817359","resolution":{"observed_at":"2026-05-17T10:46:28.677521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:e4644149e851c493a8de83809982e0ce47a8386a4a0599d43b856b1c370fe839","observation_id":"e7b9d41c-affe-4ba0-9377-5a65622b0cfc","resolution":{"observed_at":"2026-05-23T06:02:37.587807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:aec2325828bf0c6182ebffa7265d5da8240b61ddfe66bfade5e79a3a013cdc97","observation_id":"c87f1033-5839-4a62-b3a7-7730ec1d7bda","resolution":{"observed_at":"2026-05-14T00:32:41.261120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:c7e039fd57cc139ea35972679e0367dcfa9e26dea16abfcc441513a1a4509011","observation_id":"563dd0cc-1e6d-479d-beac-81df15334841","resolution":{"observed_at":"2026-05-13T20:23:51.770625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-07T12:09:07.794518Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:07.794518Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:db00d64d5bb7d993744e8b5a8c212f0a61bd71f9ae289771e51321d129448639","observation_id":"2042abbd-d90d-445f-9c54-2a82c3e8af38","resolution":{"observed_at":"2026-08-07T12:09:07.794518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-07T06:00:56.967687Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-07T21:48:03.079145Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:56.967687Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:323c4b855951cc2962e7dfd3384b7bf2cbc46689ca409b7d93790c380da4b432","observation_id":"7e5fa39a-d49d-44f5-9ae8-4c8effec6e48","resolution":{"observed_at":"2026-08-07T06:00:56.967687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T23:13:07.554817Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.554817Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:a03c4e8e3a3c1bb8fb6b496f279da7ce4eeff953afe31e22cb1ae9579864a8df","observation_id":"82ed5029-2983-493e-ab0a-c3a858ba68dc","resolution":{"observed_at":"2026-08-06T23:13:07.554817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T22:36:38.567659Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.567659Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:579facb6d322956dfa7c4162871239636fdb7818adc80f9feab7320eff3c5ea1","observation_id":"b25ca4dc-5cdc-466e-a600-f35ebdf1f7d5","resolution":{"observed_at":"2026-08-06T22:36:38.567659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T22:24:32.112310Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:32.112310Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:ec37d77d7efb1281f5999fee9a66349b31afe01724e0900841a1c12d432fab53","observation_id":"72519638-fa77-49ec-9ce6-613012807379","resolution":{"observed_at":"2026-08-06T22:24:32.112310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T20:29:54.291657Z","title":"Moviechat: From dense token to sparse memory for long video understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.291657Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:725e7abfb7546ea5997cc7e1172e9150cfee92170ad8367130bbf6212687a2fe","observation_id":"00d8e688-0c33-48cb-ab53-274cf486fbfb","resolution":{"observed_at":"2026-08-06T20:29:54.291657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T18:10:13.357356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.357356Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:674a6e20d21cdee7dc2068d25cd638c7107c6bb83c576a6ce76cea31142c3c1c","observation_id":"102ccd94-8ead-4ada-9021-3f44632e9396","resolution":{"observed_at":"2026-08-06T18:10:13.357356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-03T15:26:15.102987Z","title":"Moviechat: From dense token to sparse memory for long video understanding.arXiv preprint arXiv:2307.16449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.16978","last_updated":"2026-06-16T16:38:58Z","snapshot_observed_at":"2026-08-07T04:10:11.766593Z","submitted_at":"2025-12-18T18:59:27Z","title":"A Benchmark for Omni-Modal Reasoning in Long Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T15:26:15.102987Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2512.16978"},"observation_digest":"sha256:317620e9c21dd40cd666fecf04f6f9508bfeb231f9b91a3cb6404aaa7a047e6e","observation_id":"19bf8d62-97ee-45f3-899e-35f5b9155968","resolution":{"observed_at":"2026-08-03T15:26:15.102987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-14T22:18:56.115559Z","title":"arXiv preprint arXiv:2307.16449 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12478","last_updated":"2026-07-09T06:30:13Z","snapshot_observed_at":"2026-08-04T00:27:12.184147Z","submitted_at":"2026-03-12T21:54:50Z","title":"Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T22:18:56.115559Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.12478"},"observation_digest":"sha256:09b3393dc6ad98882fd7b484017eaf95d9b89a9f92c5e18c2e3052c0d2807ff4","observation_id":"86eb29da-14cc-4620-8d25-37ab3170b275","resolution":{"observed_at":"2026-07-14T22:18:56.115559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:5c47173bff5c31bf01606288879a1d51c9270e468b0535b523d3db5aa94328ad","observation_id":"9cf2f7bb-d52c-4ac8-b6b2-80c9624b37db","resolution":{"observed_at":"2026-05-14T22:08:04.369292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2307.16449 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-07T09:23:25.859554Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:de4d2abf032682d30ed0b745fafc6589717697f750a22a642ea65b4d21f7a494","observation_id":"3b51cd7a-8a77-4cb9-82bd-64ac814881d3","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2605.17065","last_updated":"2026-05-16T16:15:59Z","snapshot_observed_at":"2026-08-02T03:22:29.983512Z","submitted_at":"2026-05-16T16:15:59Z","title":"PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T15:12:00.408851Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2605.17065"},"observation_digest":"sha256:dc6f06a596d18ee6ae3cfd8e81b833df2bb28a6c4aaf32186952c4b4227ff8b5","observation_id":"7aeb8240-0e45-4502-b046-84e21d5d72cc","resolution":{"observed_at":"2026-05-20T15:13:24.841282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:94ce92c6d86bce18c6fb6556b6aed9ec755facbc9f7dea4f0e37abfa38da09d5","observation_id":"6de1d70f-fa3b-4953-a909-62890ec284c5","resolution":{"observed_at":"2026-07-02T12:46:56.837302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:ef31f186197f41b90fc1039e990bf82d61804091eb7302afc166f58fda3a7b3a","observation_id":"bd657a2e-9658-421b-9a36-6bdfd12428c0","resolution":{"observed_at":"2026-07-04T06:39:37.661744Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-02T18:05:44.581086Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:c530709f9751d17b351954cbcb1244d0d57475f066707d86800950aaff80ca66","observation_id":"8be66e76-6987-4810-81f7-d6d89584efc9","resolution":{"observed_at":"2026-06-30T07:54:22.343008Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-12T11:31:14.532101Z","title":"Moviechat: From dense token to sparse memory for long video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02551","last_updated":"2026-06-26T16:05:57Z","snapshot_observed_at":"2026-08-06T08:59:01.715141Z","submitted_at":"2026-06-26T16:05:57Z","title":"DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T11:31:14.532101Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2607.02551"},"observation_digest":"sha256:086e14ed56691f56b592ad7dbd5bc6aa57980e900999e8c6c1cec448aa2dd904","observation_id":"1b204ed7-b544-4d00-b49a-40961db8e10f","resolution":{"observed_at":"2026-07-12T11:31:14.532101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":"2307.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-07-10T01:36:44.033728Z","title":"Moviechat: From dense to- ken to sparse memory for long video understanding","venue":"cs.CV","work_id":"fd5baba2-50a7-4f10-894a-b2f08c7e6660","year":2023},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:2183393de207709f2cf0c6c5cb7d360a954c7ecc44be71aeb1d7003f672ea6c0","observation_id":"21063b64-1987-4fb9-add8-35b26a601fe8","resolution":{"observed_at":"2026-07-10T01:36:44.035222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2307.16449/citation-record","integrity":"/paper/2307.16449/integrity","json":"/paper/2307.16449/citation-record.json","paper":"/paper/2307.16449"},"outbound":[],"paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2307.16449."}