{"as_of":"2026-08-18T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75746f1e11d335064a8eef3bee86e7f42ea46c10ed81059f282578a428c33802","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:17.302898Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02946/citation-record","integrity":"/paper/2507.02946/integrity","json":"/paper/2507.02946/citation-record.json","paper":"/paper/2507.02946"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:59:15.678922Z","title":"5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.678922Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:99e07648f267eb52474a81010226d4e9d318519ce3e0e7491aef34e1a1d384c0","observation_id":"2df4ca94-0573-4ef3-8129-00b94da7f0f4","resolution":{"observed_at":"2026-08-06T21:59:15.678922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-16T14:40:30.885658Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-06T21:59:15.758936Z","title":"arXiv preprint arXiv:2311.14906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.758936Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:ad48e0555ab1d7eb0cc42dd817b4c734e253961895e8015a7269f21bd914e2ed","observation_id":"29312749-d544-4313-a39f-c76c0a07fece","resolution":{"observed_at":"2026-08-06T21:59:15.758936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-16T12:44:19.528630Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-06T21:59:15.855545Z","title":"arXiv preprint arXiv:2504.02438","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.855545Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:9af41d772e8aa995cdf73348605744c97b175609e9f995182a58d54a21b5ef97","observation_id":"b4e04e31-54a1-4856-ae77-3dd741cf5db7","resolution":{"observed_at":"2026-08-06T21:59:15.855545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T21:59:16.010886Z","title":"arXiv preprint arXiv:2503.21776","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.010886Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:a814fd44d776ab905b4082ecc1d4354381e022bbece4eb1f516655262feeff14","observation_id":"f02e1bab-94e6-4fcd-92b6-0f79569b36ec","resolution":{"observed_at":"2026-08-06T21:59:16.010886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T21:59:16.134001Z","title":"arXiv preprint arXiv:2405.21075","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.134001Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:6e3a86890bc0746c01439a5a3f68b216c7b7997375f33bf9d9699368fdcf0813","observation_id":"48c49d92-36e3-48a5-acaf-059faa0018a9","resolution":{"observed_at":"2026-08-06T21:59:16.134001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-08-15T11:39:07.998070Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-06T21:59:16.221161Z","title":"arXiv preprint arXiv:2305.14992","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.221161Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:81a9f7e06ed79750f641a4beb7f0b84ada4055baf0f7ab7e971989bd6a18a8d7","observation_id":"6048adb1-94be-4ff2-b950-086bcb07d394","resolution":{"observed_at":"2026-08-06T21:59:16.221161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11865","last_updated":"2025-05-16T06:50:09Z","snapshot_observed_at":"2026-08-17T03:03:23.284563Z","submitted_at":"2024-04-18T02:43:37Z","title":"From Image to Video, what do we need in multimodal LLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11865","snapshot_observed_at":"2026-08-06T21:59:16.278173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.278173Z"},"links":{"cited_paper":"/paper/2404.11865","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:8433a08f574df7f057bc89ee0b151ba0e3b5836e12edde33ee0231d96ada46a5","observation_id":"8faf21c6-a3bf-4ade-a893-cd6fe75dedf0","resolution":{"observed_at":"2026-08-06T21:59:16.278173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T21:59:16.444148Z","title":"arXiv preprint arXiv:2305.06355","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.444148Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:0b759a95eaecca3c478dbaedbc8d468ba1850452372ad8e2712d51e8af34f74e","observation_id":"110c9dea-d75d-4a06-9dd8-94baa733e875","resolution":{"observed_at":"2026-08-06T21:59:16.444148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T21:59:16.488837Z","title":"arXiv preprint arXiv:2311.10122","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.488837Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:3e64aada296e75761075cba2237709cb3f2eb05202e2f66d60836a26649d2099","observation_id":"08d20e2c-0330-46ff-9b67-fe558e1ebfba","resolution":{"observed_at":"2026-08-06T21:59:16.488837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-08-06T21:59:16.530036Z","title":"arXiv preprint arXiv:2411.02327","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.530036Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:0f56d14fc494c9f22bc870f6c5eab61e6afaa65b0f2cb8ad15d44eea6711e584","observation_id":"a2ad6307-3313-41c9-887d-fdf025e90a0e","resolution":{"observed_at":"2026-08-06T21:59:16.530036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05615","last_updated":"2026-05-12T03:37:41Z","snapshot_observed_at":"2026-08-13T06:13:12.956934Z","submitted_at":"2024-06-09T02:36:28Z","title":"Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05615","snapshot_observed_at":"2026-08-06T21:59:16.614884Z","title":"arXiv preprint arXiv:2406.05615","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.614884Z"},"links":{"cited_paper":"/paper/2406.05615","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:13c69e939eb19843534c8daf194abb53baf1caf25b42fedf3a6bbc279a66d380","observation_id":"b822c8c7-c8c3-4c25-8055-bba79cbf1794","resolution":{"observed_at":"2026-08-06T21:59:16.614884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-16T14:39:55.654977Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-06T21:59:16.696016Z","title":"arXiv preprint arXiv:2311.16103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.696016Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:87c8c1dabb386f253d4bf6c72f124c3978b8fbac1bac1f5a749f6d8314c32ce2","observation_id":"7d870a68-30b1-48c1-adc5-d6dd3459f69a","resolution":{"observed_at":"2026-08-06T21:59:16.696016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-08-15T05:00:23.895770Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-06T21:59:16.773771Z","title":"Shu, Y .; Liu, Z.; Zhang, P.; Qin, M.; Zhou, J.; Liang, Z.; Huang, T.; and Zhao, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.773771Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:c1580b30827b531317b0b4faac4b29a7dc5de03fe6e790a76fcd1f9b8c759b39","observation_id":"ca388100-361a-4ccc-b685-43025ec203b4","resolution":{"observed_at":"2026-08-06T21:59:16.773771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-16T13:16:29.857447Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T21:59:16.899236Z","title":"arXiv preprint arXiv:2409.14485","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.899236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:ed4d1c0eddb361a2a8ea46f06fad39794d26fbe908c026db51e47389fc8ed835","observation_id":"a03ecc67-4006-4690-9bf6-bdae02f2ad6f","resolution":{"observed_at":"2026-08-06T21:59:16.899236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:59:16.981202Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.981202Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:08018c6e656e0ba130d645a3f29061e66012a621588d3fa0a0582af21ae8ae0f","observation_id":"91492b46-e8be-4b35-8952-a6a972a07059","resolution":{"observed_at":"2026-08-06T21:59:16.981202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T21:59:17.153103Z","title":"arXiv preprint arXiv:2404.16994","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.153103Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:5c0a54de5da82ee677b8b73dc98f97edc9797f19492d758aba41b9d701af6094","observation_id":"587ba512-870c-4a04-bbaa-48b8069a308f","resolution":{"observed_at":"2026-08-06T21:59:17.153103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T21:59:17.302898Z","title":"arXiv preprint arXiv:2306.02858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.302898Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:2c43b5532daf993241b772903b6039e07e1486384df93bc7aad6eb0e93888fcd","observation_id":"53a350c1-9421-43e5-a25b-1b0516cc88a1","resolution":{"observed_at":"2026-08-06T21:59:17.302898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:59:16.364927Z","title":"Artificial intelligence, 27(1): 97–109","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":1985,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.364927Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:166a4e194fa562b10b13c4d195a6394a5125f55b7bcc9af3e125efd37d0e82dc","observation_id":"ca2d00a3-b6ba-4815-aa27-272eeedd7da0","resolution":{"observed_at":"2026-08-06T21:59:16.364927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-08-16T13:44:06.820169Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-06T21:59:17.224605Z","title":"Current directions in psychological science, 16(2): 80–84","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.224605Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:674beb05325f0f8515f65e586eca45e7fb305b3487f1411bbdc3ca8432334696","observation_id":"a3101767-ba83-4287-90e5-94ed395b9614","resolution":{"observed_at":"2026-08-06T21:59:17.224605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T21:59:17.058810Z","title":"arXiv preprint arXiv:2203.11171","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.058810Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:673265c1b86715ccda0da341e6f8a83e92481a608df7f4f05bc71a6db2ef1a49","observation_id":"ec3ffded-ef9e-43d7-ad38-a67c8cf17179","resolution":{"observed_at":"2026-08-06T21:59:17.058810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:59:15.515921Z","title":"arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.515921Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:8c86c7591879273db964589026f13e57090227bb8461609758d319fdfaae0930","observation_id":"a3e1ddd9-6e69-43fd-9211-6e2a79ced978","resolution":{"observed_at":"2026-08-06T21:59:15.515921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-08-17T20:22:23.176057Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-06T21:59:15.950597Z","title":"arXiv preprint arXiv:2406.14515","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.950597Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:c374d41641b67372016614378e2514d902a89e8fddbd5e05f7f1f2b91171a787","observation_id":"07a3c23f-0848-4e87-9a93-13c1267286ba","resolution":{"observed_at":"2026-08-06T21:59:15.950597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02175","last_updated":"2025-04-01T19:02:04Z","snapshot_observed_at":"2026-08-16T12:53:24.038212Z","submitted_at":"2025-03-04T01:33:14Z","title":"DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02175","snapshot_observed_at":"2026-08-06T21:59:15.578220Z","title":"arXiv preprint arXiv:2503.02175","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.578220Z"},"links":{"cited_paper":"/paper/2503.02175","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:bb894167918d34d6b88c37502d481c0e684c9da5cf00f22c24ebfeda457d9468","observation_id":"0ebdbcd1-1622-47c7-8529-22f36dd1d1dc","resolution":{"observed_at":"2026-08-06T21:59:15.578220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T16:57:48.372979Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2507.02946."}