{"as_of":"2026-08-09T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2072d73611324d0c6dda472f6cb592b89c1ef31b0587d111e3775fa7a132b264","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:41:44.374259Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:35:01.039481Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:acde40268e8800f4e4ac523a49c9b27141e77a62aca87630a62aa10067879694","observation_id":"973d328e-1357-49cc-b90e-1af090db8bb9","resolution":{"observed_at":"2026-05-18T04:55:20.473273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:ddcedbd8c9065558ee476792328abbead1a3e7370d758ede3725cb8fcc2c0862","observation_id":"73a3776b-4a93-41a3-a408-726ba5d7b8c5","resolution":{"observed_at":"2026-05-17T02:46:16.731922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:1097336baef7875062cd2adbbd887bb4936c92aa2dfdedd87b7691fa8d325a1f","observation_id":"081ced19-1148-469e-8efd-826183496418","resolution":{"observed_at":"2026-05-17T07:44:47.497607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:fab5810bd804ffaecf74cd0b18068bd1912578dacb1fa227f4d796e358075221","observation_id":"61fb005d-633c-49e3-a414-192694e8cc4c","resolution":{"observed_at":"2026-05-15T20:21:57.974849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:21e85375f862899359e1715dbcf485e82baae258081dc9b51d2c89e55325b95b","observation_id":"d26af7f3-d15e-46d6-8cfc-cf9220c4f338","resolution":{"observed_at":"2026-05-14T19:55:26.389857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:bdbe7f6bf781d0c471ef3b590a5e177b4fd3738c52755c47a7b82c8c3be16d2e","observation_id":"31eeb163-b9d7-451e-ad84-70b55c64fd6f","resolution":{"observed_at":"2026-05-19T11:55:30.195081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:b2315a7f9988eb979d05dcfe642cae001a138e88842d332ad497256a5243e57c","observation_id":"7b089da6-9c35-461c-bc2c-368e96b13c4d","resolution":{"observed_at":"2026-05-17T10:46:28.654562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:18fef078eec48f35ce211bb9a06be08a829fa6a2d312ae5fd0c3adf7e7f84e6e","observation_id":"075a7d8a-4684-4e04-b3e0-ef9b26d2067e","resolution":{"observed_at":"2026-05-11T06:01:54.037741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.08101","last_updated":"2026-04-14T18:39:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-11T00:10:45Z","title":"What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T22:51:08.753650Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.08101"},"observation_digest":"sha256:29718723827aeac89924568fda3749e81c12cd98998219b5579fd767630ca278","observation_id":"fc8b33c8-ddc1-4220-9ece-ac46ead134ee","resolution":{"observed_at":"2026-05-23T22:53:33.157114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:512576bea90e785aaa3a99cf23d4f59948eb9285dc59a860e527427c17922712","observation_id":"170e0518-604d-4cd6-a103-28c2ad1cb0fb","resolution":{"observed_at":"2026-05-17T03:51:25.511626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:77f09b62af598d349a33b62de2bfb1870ff1ba25a59a3b3d05bc78e668038df1","observation_id":"81baf91d-9190-46e9-a25f-7aca2b3d8d6b","resolution":{"observed_at":"2026-05-10T23:20:32.978337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T19:51:36.137985Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2412.06224"},"observation_digest":"sha256:70b72e4a9000e6f328100127192a1c4d50d6c3276e1531d9ee9e5d4c71b5b152","observation_id":"e6fb5e39-367d-4e45-a0c8-deebae6711f9","resolution":{"observed_at":"2026-05-16T19:51:36.333783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-09T11:41:44.374259Z","title":"Shot2story20k: A new benchmark for comprehen- sive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02589","last_updated":"2025-02-04T18:59:46Z","snapshot_observed_at":"2026-08-09T11:35:42.990078Z","submitted_at":"2025-02-04T18:59:46Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:41:44.374259Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2502.02589"},"observation_digest":"sha256:0a421b80f8d895d73fef1d40c526c1eca0a7762b8dc45cfabd87fdc3855bd109","observation_id":"a3e050ee-0325-4f06-816d-1974903bb38e","resolution":{"observed_at":"2026-08-09T11:41:44.374259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T12:58:40.004022Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.004022Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b5746590012266ce56186635552f57142c53881c68624a242c383232102689a5","observation_id":"c4fe22d9-0890-46e7-b489-e5439882b89b","resolution":{"observed_at":"2026-08-07T12:58:40.004022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T12:26:37.635595Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24476","last_updated":"2025-05-30T11:23:21Z","snapshot_observed_at":"2026-08-09T05:31:37.592410Z","submitted_at":"2025-05-30T11:23:21Z","title":"Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:37.635595Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2505.24476"},"observation_digest":"sha256:a390508d4e4bed4968d7f3a2963c34fcdd1c0bc0aab1ac084d77e0f95962f7d0","observation_id":"dda92986-97d9-43fb-b6ad-ba90a10bd94c","resolution":{"observed_at":"2026-08-07T12:26:37.635595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T11:59:07.537007Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.537007Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:beb8914c17c0bd767fc9d238f9f560fca25c7eb37faa70987f07a0b94beb240a","observation_id":"02ef2d55-2f23-47e2-b7f1-85fa1b1795f0","resolution":{"observed_at":"2026-08-07T11:59:07.537007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T11:41:45.444716Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01738","last_updated":"2025-06-02T14:48:15Z","snapshot_observed_at":"2026-08-09T15:21:33.651698Z","submitted_at":"2025-06-02T14:48:15Z","title":"STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:41:45.444716Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.01738"},"observation_digest":"sha256:97679773bd8786389da5bbe790c13f8eac7cf161a0bbad8fffc2a9096193c573","observation_id":"fe0280de-c759-4176-aace-871854251637","resolution":{"observed_at":"2026-08-07T11:41:45.444716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T05:49:53.416913Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.416913Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4e707e70bffe60cfcaf7d009f8788e41dbd73307125af2764916c94433a9d9c8","observation_id":"dc8fecce-635a-4350-823e-a604ad8268a5","resolution":{"observed_at":"2026-08-07T05:49:53.416913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T00:33:19.326679Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.326679Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:336cff7f0731a879d8456043d31d8067a33ef4bf593198cb9f02a708c1a989e8","observation_id":"fa43ef72-8084-4d98-b812-6fccee3b5343","resolution":{"observed_at":"2026-08-07T00:33:19.326679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T23:13:07.193817Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.193817Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:78e3810cf477d91a2056b25ac903a872fdb0576dd2f136069e9cdd31ec15a7ca","observation_id":"f9bd112b-a33b-408d-b03c-4849703a8fb1","resolution":{"observed_at":"2026-08-06T23:13:07.193817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T22:36:37.514961Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:37.514961Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:d5caaa1bc26512b062655700e044e8403084351f41f78458199e464a976b7720","observation_id":"3de1bfdc-6e02-41d3-98f1-9a17c5964c27","resolution":{"observed_at":"2026-08-06T22:36:37.514961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T20:29:52.144931Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:52.144931Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:ef77ee709559b85f2e3ac02a663bc01c258121030b5e2c64b9058ef608ceb341","observation_id":"2efa0987-9240-45d2-aa06-4a09a803cc06","resolution":{"observed_at":"2026-08-06T20:29:52.144931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-06T14:47:28.740370Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17844","last_updated":"2025-07-23T18:11:39Z","snapshot_observed_at":"2026-08-07T13:01:45.072087Z","submitted_at":"2025-07-23T18:11:39Z","title":"SV3.3B: A Sports Video Understanding Model for Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:47:28.740370Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.17844"},"observation_digest":"sha256:0e2217f834fa633ed986e6121a8a4f21e40e62ec8013d1f63db8f5891da99519","observation_id":"00d64863-bf51-4eca-aa1e-a18a39129839","resolution":{"observed_at":"2026-08-06T14:47:28.740370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-06T19:44:38.919643Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:d0f14eb058509e95afdce881681aa2e8e0a52b13144c801792c039468c43eb31","observation_id":"be12beba-f4bf-4e8c-96dd-2118725ef2ad","resolution":{"observed_at":"2026-05-19T03:22:01.230172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-05T13:46:01.099735Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-09T06:09:58.396638Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.099735Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:03d52021dae090271edf980e8358585f025d3b8c4337cbad71cdb86c423f14d8","observation_id":"f98a0e98-a01c-4b5a-a1a9-de828b50673f","resolution":{"observed_at":"2026-08-05T13:46:01.099735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-04T09:12:08.173803Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.17045","last_updated":"2026-06-01T07:19:41Z","snapshot_observed_at":"2026-08-04T09:12:02.562884Z","submitted_at":"2025-10-19T23:17:13Z","title":"Video Reasoning without Training","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T09:12:08.173803Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2510.17045"},"observation_digest":"sha256:26cb839410039cc4b216aa7b1f56aa18dadb6d372c764f7f9ffbe646b2f30791","observation_id":"68cc46ca-92bd-4dd7-9f09-73c833ef94d6","resolution":{"observed_at":"2026-08-04T09:12:08.173803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:ca1584211dcae5957c6d835145e3937ad3304a56b0012453ba08c612517e0ddc","observation_id":"be4b702d-4fc2-4de9-bbd3-c0e28db84eaa","resolution":{"observed_at":"2026-05-14T22:08:04.347146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2605.16740","last_updated":"2026-06-01T13:41:41Z","snapshot_observed_at":"2026-08-01T07:38:35.881679Z","submitted_at":"2026-05-16T01:37:10Z","title":"TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T21:36:43.971666Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2605.16740"},"observation_digest":"sha256:fef9ed1dd7543b258ea3776e1bacfe2ca093ee69bb0ac905be1e43ec0f157df8","observation_id":"dd36a994-d8b2-4431-b287-a07b92f577df","resolution":{"observed_at":"2026-05-19T21:37:47.904757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2605.16740","last_updated":"2026-06-01T13:41:41Z","snapshot_observed_at":"2026-08-01T07:38:35.881679Z","submitted_at":"2026-05-16T01:37:10Z","title":"TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T19:33:24.558488Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2605.16740"},"observation_digest":"sha256:ec6a66950707df912d13794b05279866d9982d6de385b70a9fc7fb265f26c520","observation_id":"bf2a9c55-f062-401e-9692-ed22c84b8528","resolution":{"observed_at":"2026-06-30T19:35:01.040957Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2605.19950","last_updated":"2026-05-19T15:05:00Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:05:00Z","title":"AffectVerse: Emotional World Models for Multimodal Affective Computing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T06:46:33.612905Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2605.19950"},"observation_digest":"sha256:428a16eaf7164ab630690bda846a8bf3bb38fed15a1111b60833380818aed1b8","observation_id":"bc6cffe9-4ff9-4f63-b216-8efe10b6a225","resolution":{"observed_at":"2026-05-20T06:48:05.768202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-12T09:09:15.248815Z","title":"Llama-vid: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02607","last_updated":"2026-07-01T13:51:02Z","snapshot_observed_at":"2026-07-12T09:09:14.587474Z","submitted_at":"2026-07-01T13:51:02Z","title":"Latent Visual Cache for Video Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T09:09:15.248815Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.02607"},"observation_digest":"sha256:6153d9b57b7bfb78b2b798f468c9fdfb0ad5d83215d1d3230fb9a216977cead3","observation_id":"35d8a661-3f92-4a48-94f2-fc65384c5157","resolution":{"observed_at":"2026-07-12T09:09:15.248815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2311.17043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":188,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:7eaabe1f6bb1ebcf89dd30f53ef13c2996d6f573d89d4262fedce06a0fa11cd6","observation_id":"fa248f94-9bc2-4a6a-8b45-563b728ff2ec","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2311.17043 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-08-09T14:49:10.281004Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:b59608bec18bc178679fa0b578288d691016ab87f21f3ea7a253450032d6b7ef","observation_id":"6da9c10c-6546-4c8f-b1d6-032321ab34ad","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-07-31T06:20:13.729612Z","title":"LLaMA-VID: An image is worth 2 tokens in large language models.arXiv preprint arXiv:2311.17043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-07T06:47:24.083796Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.729612Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:ce5fc55082acac4f097c961ae18b6e181c39f36f4359ba7cf6cb53a9dda0f893","observation_id":"4228e8d1-8124-4ab5-b3d3-f7c6d59913a9","resolution":{"observed_at":"2026-07-31T06:20:13.729612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.17043/citation-record","integrity":"/paper/2311.17043/integrity","json":"/paper/2311.17043/citation-record.json","paper":"/paper/2311.17043"},"outbound":[],"paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2311.17043."}