{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86a190f99752626ba84c3cc562e162d931ba69c5d5323cc69407a0b41887d1ab","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:35.547483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:57.839456Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:94d8e4d1d13a0a6a26e7571b9903a73c36e74bd3437de1251720a11f2daef172","observation_id":"c541cc23-02e0-4193-9ac5-4076649b7a59","resolution":{"observed_at":"2026-05-15T06:30:22.601941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2309.17257","last_updated":"2026-04-12T21:40:57Z","snapshot_observed_at":"2026-07-06T16:25:29.858870Z","submitted_at":"2023-09-29T14:07:56Z","title":"A Survey on Deep Learning Techniques for Action Anticipation","version":2},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-24T06:41:15.508744Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2309.17257"},"observation_digest":"sha256:5ed9f7b72e62a1e6231a661232073d232c54705adf8b23eea6aec53bed0db96e","observation_id":"81c23fb6-b03e-401e-be30-7c26780bc04f","resolution":{"observed_at":"2026-05-24T06:44:02.395401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:755465e91b8addd25778fa4616e5e891f1f82b633e163ec664ed72b5a43bc62a","observation_id":"d701eab2-8540-42d2-8903-ccc673024f4b","resolution":{"observed_at":"2026-05-18T02:29:46.398222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T01:29:30.032408Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2403.14624"},"observation_digest":"sha256:eff980c7849cf7bb7b42eb72e8abbb9c178798bf8af9b4d28a33648132693438","observation_id":"dfe2ba98-9681-486e-9835-546287e6b040","resolution":{"observed_at":"2026-05-17T01:29:30.137998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:ba799b8f65c06e1f206c74410cbccd2c4a62462dbe50655239eec5b33ccafafc","observation_id":"8f243c46-e496-4bbc-a599-432d3c31c16a","resolution":{"observed_at":"2026-05-12T20:58:59.355312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:b66906019034fedab9722be641c0491541d32b215ca0b3fb6aa0f8868d45ffe0","observation_id":"ab5faf8c-5e75-43c2-9170-1fa85c9b3b3e","resolution":{"observed_at":"2026-05-15T20:21:57.913457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:3df35c7d00814aa35d8fed6f36c6e90358ef7fb70ba4cb882621600480754222","observation_id":"010363d5-1c73-4422-9399-4cab4a8f1a34","resolution":{"observed_at":"2026-05-11T06:01:53.863823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2410.14702","last_updated":"2026-05-10T19:30:43Z","snapshot_observed_at":"2026-07-06T19:36:10.759412Z","submitted_at":"2024-10-06T20:35:41Z","title":"Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T20:03:38.336841Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2410.14702"},"observation_digest":"sha256:b010c8061accecdcde7cf913c8a7e52d03272bee7201d47a1737a924033dad7d","observation_id":"d481ca96-e0bd-4cfd-809f-c21b49e89785","resolution":{"observed_at":"2026-05-23T20:05:47.885048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T11:49:35.547483Z","title":"VideoLLM: Modeling video sequence with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01364","last_updated":"2025-06-02T06:46:42Z","snapshot_observed_at":"2026-08-08T09:15:38.444850Z","submitted_at":"2025-06-02T06:46:42Z","title":"Unraveling Spatio-Temporal Foundation Models via the Pipeline Lens: A Comprehensive Review","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:35.547483Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.01364"},"observation_digest":"sha256:2ebe6e5a3082c5ea008d19f87b12e68ada761eba943a43e983f9159fa72dda75","observation_id":"ea33adac-2adf-43ce-9ea8-1726e3a9c4f6","resolution":{"observed_at":"2026-08-07T11:49:35.547483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T11:25:25.106038Z","title":"Videollm: Modeling video sequence with large language models.arXiv preprint arXiv:2305.13292, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02550","last_updated":"2025-06-11T11:16:41Z","snapshot_observed_at":"2026-08-08T21:33:55.672848Z","submitted_at":"2025-06-03T07:36:52Z","title":"Technical Report for Ego4D Long-Term Action Anticipation Challenge 2025","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:25:25.106038Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.02550"},"observation_digest":"sha256:157bb93c8dd02a9e6159f9c088f0418d32b28d4ea2fd1bffd178fa7934da9730","observation_id":"86bdf106-656d-47b7-af83-bd2fd6592189","resolution":{"observed_at":"2026-08-07T11:25:25.106038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T10:27:05.509262Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.509262Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:df0a8fdc3578e03c2d2bb91dd2c146e9db30cb0734ed13900e08a7cd5cfb9096","observation_id":"5e2d9d77-a5ee-42a6-8377-2f5e94b38832","resolution":{"observed_at":"2026-08-07T10:27:05.509262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T10:28:46.876212Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-09T02:08:19.234840Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:46.876212Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:9df4d01f9b4000e8aaab7cb90f0321670a1dfc664df22e8082c466b02463b19a","observation_id":"d0b2b3f3-62bc-4850-aaa8-558c9c09418e","resolution":{"observed_at":"2026-08-07T10:28:46.876212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T11:11:40.910714Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05395","last_updated":"2025-09-02T17:50:58Z","snapshot_observed_at":"2026-08-09T14:06:01.941872Z","submitted_at":"2025-06-03T19:44:49Z","title":"TriPSS: A Tri-Modal Keyframe Extraction Framework Using Perceptual, Structural, and Semantic Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.910714Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.05395"},"observation_digest":"sha256:44a754f7ee2940dd2d1b34b1b41621c705b6d69da59461d0e7fad820e42c734f","observation_id":"0a03daa1-2d5c-431d-b20d-263c1ca55de5","resolution":{"observed_at":"2026-08-07T11:11:40.910714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T06:00:58.649184Z","title":"Videollm: Modeling video sequence with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06253","last_updated":"2025-06-06T17:25:48Z","snapshot_observed_at":"2026-08-09T07:19:17.693738Z","submitted_at":"2025-06-06T17:25:48Z","title":"Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision","version":1},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:58.649184Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.06253"},"observation_digest":"sha256:6ae37b4f46d7a6c0c2173c9c3101d1916dded6fe7f55f6a3246d41445672090d","observation_id":"a83717f8-8b63-476c-98ca-bf04eebc46aa","resolution":{"observed_at":"2026-08-07T06:00:58.649184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T14:36:28.824818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.824818Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:8a33915d2b9d4df30468e9e67039079975386eae4abcec53bfc76e3faf4ab82b","observation_id":"bbb85bc4-a452-4b8e-8689-a4428efd383a","resolution":{"observed_at":"2026-08-06T14:36:28.824818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T13:48:01.473477Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.473477Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:780f1c6ff7e96785328dc051ee8a8e673accba53ce3bef73087bfe1114ba6baa","observation_id":"73726ca9-4546-48a2-8657-49909d9a5b56","resolution":{"observed_at":"2026-08-06T13:48:01.473477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T10:13:21.401166Z","title":"VideoLLM: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00374","last_updated":"2025-08-01T07:07:24Z","snapshot_observed_at":"2026-08-09T07:30:54.216249Z","submitted_at":"2025-08-01T07:07:24Z","title":"Bidirectional Action Sequence Learning for Long-term Action Anticipation with Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:13:21.401166Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2508.00374"},"observation_digest":"sha256:975ac88648524fc6dd981f58fc39adbedb62c7c1c4d324014e987cc51584c16c","observation_id":"7dfa47f3-9922-4b81-8194-46f26f8dda1d","resolution":{"observed_at":"2026-08-06T10:13:21.401166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:f2323dc4c7729e9c757d882b6687d233f0df42d4a1fe40434f42b02cdbee83ef","observation_id":"367ec431-a646-46d0-a3c7-c31da349848e","resolution":{"observed_at":"2026-05-19T00:12:54.074518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:45af02332fd7b60d3a8023a299768a5d787786e77c61494f71d3c847e5bcc046","observation_id":"25faba18-f547-4682-8c3b-082d20a552dd","resolution":{"observed_at":"2026-05-25T08:05:30.762307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-05T10:59:05.132385Z","title":"Videollm: Modeling video se- quence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-08T23:16:11.446216Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.132385Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:b72fc29848316a7fcfb119477b3bdc3b24f1ff3168bc64d9e6edb3546b20fa3f","observation_id":"a96d9ce7-a49e-49c9-a47c-9a59b83bc134","resolution":{"observed_at":"2026-08-05T10:59:05.132385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4634003c9354f516b614d57e6c36071a7ac61663b577be388e1300bb6a1e220c","observation_id":"505e4779-9191-4b37-96e9-7e41a182180c","resolution":{"observed_at":"2026-05-11T08:30:57.075105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:b7d506fdde9e16a903010d503d8ef7e9472368b4dcd72db8eb21481880712f03","observation_id":"ca07bbee-5094-45c2-b6bd-53e77596f81a","resolution":{"observed_at":"2026-05-11T15:21:09.457612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2605.02912","last_updated":"2026-04-07T20:15:15Z","snapshot_observed_at":"2026-08-08T15:05:59.571219Z","submitted_at":"2026-04-07T20:15:15Z","title":"Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T19:04:20.674374Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2605.02912"},"observation_digest":"sha256:dc8d01258486d857aadeb53643a7f9cab44a0f55dd6b095a6d54117593bce403","observation_id":"86af773a-8a1e-4a66-8a69-88ca542db661","resolution":{"observed_at":"2026-05-10T23:30:51.938785Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2606.00640","last_updated":"2026-05-30T09:30:30Z","snapshot_observed_at":"2026-08-06T02:39:29.306378Z","submitted_at":"2026-05-30T09:30:30Z","title":"An Attribute-Based Measure of Video Complexity","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:00:54.718177Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2606.00640"},"observation_digest":"sha256:6a139cf121f41ddbab25664f54cb74af2179de2e458d13fe2d9a753ca61e6da5","observation_id":"df02794c-9aaf-4d32-856d-c0aa80f3e09f","resolution":{"observed_at":"2026-06-28T19:02:34.097031Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:d2edc8a97a286d2ce4fb4a98255af42aa683b8b071c3005b1c2db980562082c9","observation_id":"ec893098-6043-4d53-9a47-88dc7f1c0ffb","resolution":{"observed_at":"2026-07-03T10:48:03.063320Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-08T01:57:17.698279Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:853aebfdd05417c1c38afa2cc905617fe301a4f042437715adb4eaddc8b1193e","observation_id":"a924f3ed-4503-416d-899e-a1de50b91659","resolution":{"observed_at":"2026-07-03T20:18:57.842377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-02T04:39:20.337796Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16322","last_updated":"2026-07-15T09:37:58Z","snapshot_observed_at":"2026-08-09T21:37:18.308785Z","submitted_at":"2026-07-15T09:37:58Z","title":"GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:20.337796Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2607.16322"},"observation_digest":"sha256:24bf28f278193ead2b555e48b4567012a054f095dd9596b691bab9fdde3848f2","observation_id":"204689fb-d777-4c79-b01f-1969c1657c9f","resolution":{"observed_at":"2026-08-02T04:39:20.337796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.13292/citation-record","integrity":"/paper/2305.13292/integrity","json":"/paper/2305.13292/citation-record.json","paper":"/paper/2305.13292"},"outbound":[],"paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2305.13292."}