{"as_of":"2026-08-09T15:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f0c3e036f689fcb74aeaed10ff69d62e00919971d9088147ffcc7244a5461da","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:58:28.781308Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:21:30.774303Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T12:53:05.467023Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09491","snapshot_observed_at":"2026-08-06T12:21:30.774303Z","title":"Glimpse: Do large vision-language models truly think with videos or just glimpse at them?arXiv preprint arXiv:2507.09491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21858","last_updated":"2025-07-29T14:31:17Z","snapshot_observed_at":"2026-08-07T08:25:25.968013Z","submitted_at":"2025-07-29T14:31:17Z","title":"Low-Cost Test-Time Adaptation for Robust Video Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:21:30.774303Z"},"links":{"cited_paper":"/paper/2507.09491","citing_paper":"/paper/2507.21858"},"observation_digest":"sha256:a1a24348de42b4e5ea762d20545317c7caccf1026f459e80ea155494745f193c","observation_id":"237a465b-3f7e-41f7-992a-de9b69301f24","resolution":{"observed_at":"2026-08-06T12:21:30.774303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"cited_work":{"arxiv_id":"2507.09491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09491","snapshot_observed_at":"2026-08-05T12:53:05.467023Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","venue":"cs.CV","work_id":"450df290-071a-4ddb-893a-bfa7c883c9b8","year":2025},"citing_paper":{"arxiv_id":"2509.01161","last_updated":"2025-09-01T06:34:53Z","snapshot_observed_at":"2026-08-09T11:10:14.193729Z","submitted_at":"2025-09-01T06:34:53Z","title":"Multi-Modal Machine Learning Framework for Predicting Early Recurrence of Brain Tumors Using MRI and Clinical Biomarkers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T12:53:04.416698Z"},"links":{"cited_paper":"/paper/2507.09491","citing_paper":"/paper/2509.01161"},"observation_digest":"sha256:0ba589f693f7f90ed0e72ddd701144e6ffa7a1b0773133c63b67dfffabc7289a","observation_id":"68f4f59a-9d09-44bc-bba5-561a89b54990","resolution":{"observed_at":"2026-08-05T12:53:05.471912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09491","snapshot_observed_at":"2026-08-05T12:53:15.118127Z","title":"Glimpse: Do large vision-language models truly think with videos or just glimpse at them?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01164","last_updated":"2025-09-01T06:37:20Z","snapshot_observed_at":"2026-08-07T08:25:18.827191Z","submitted_at":"2025-09-01T06:37:20Z","title":"A Multimodal Deep Learning Framework for Early Diagnosis of Liver Cancer via Optimized BiLSTM-AM-VMD Architecture","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T12:53:15.118127Z"},"links":{"cited_paper":"/paper/2507.09491","citing_paper":"/paper/2509.01164"},"observation_digest":"sha256:0808f88929da213180724af734fa6500048212eeb8293e39c977cd7daad40d4c","observation_id":"f14a26fc-4da5-4428-b4a9-2c93fcae3bf0","resolution":{"observed_at":"2026-08-05T12:53:15.118127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09491/citation-record","integrity":"/paper/2507.09491/integrity","json":"/paper/2507.09491/citation-record.json","paper":"/paper/2507.09491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-06T17:58:27.085682Z","title":"arXiv preprint arXiv:2311.14906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.085682Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:b04be5d9d84136a40427b5b409fed24664e1f2bda21e7411193b13ad4aacaac1","observation_id":"d34b630c-e942-4ef4-8a8a-0d5a9c2c5151","resolution":{"observed_at":"2026-08-06T17:58:27.085682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T17:58:27.181609Z","title":"arXiv preprint arXiv:2406.07476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.181609Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:c95b8cea9ed9cd7d624ea6f9be86b8138e79e578f5a1fc18e04f8b7aa2bd6ccc","observation_id":"2ceb502e-6b49-4ab2-a2ca-701b69ed2a18","resolution":{"observed_at":"2026-08-06T17:58:27.181609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T17:58:27.320461Z","title":"arXiv preprint arXiv:2405.21075","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.320461Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:3bb20f7adc670516be7651eca165cdb92c50bf31ab646541725a833bcdde73ae","observation_id":"b4de45de-7812-4775-9d3e-8ec6a1d423cb","resolution":{"observed_at":"2026-08-06T17:58:27.320461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-07-06T16:47:17.136168Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-08-06T17:58:27.390172Z","title":"arXiv preprint arXiv:2311.08046","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.390172Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:59fbf08a80872165d221ead10df802fb963daaace834eb9d688025e32127bb74","observation_id":"429e1c97-5d48-4974-bca6-377506aab120","resolution":{"observed_at":"2026-08-06T17:58:27.390172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07022","last_updated":"2023-11-13T02:13:13Z","snapshot_observed_at":"2026-08-07T08:25:26.351749Z","submitted_at":"2023-11-13T02:13:13Z","title":"ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models","version":1},"cited_work":{"arxiv_id":"2311.07022","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07022","snapshot_observed_at":"2026-08-06T17:58:29.104450Z","title":"ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models","venue":"cs.CL","work_id":"5fa242fe-1304-429f-9deb-b4664ce853d2","year":2023},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.448450Z"},"links":{"cited_paper":"/paper/2311.07022","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:a000f5bc13c1b374a3faf3a726d56c030198cc111403cf26fe132a84219e13ca","observation_id":"5a7676cf-84d0-49ea-9aba-f61972b1194c","resolution":{"observed_at":"2026-08-06T17:58:29.172776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11865","last_updated":"2023-11-20T16:02:10Z","snapshot_observed_at":"2026-07-06T16:50:02.155961Z","submitted_at":"2023-11-20T16:02:10Z","title":"VLM-Eval: A General Evaluation on Video Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11865","snapshot_observed_at":"2026-08-06T17:58:27.497281Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 22195–22206","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.497281Z"},"links":{"cited_paper":"/paper/2311.11865","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:e5b69f477bcce875f91fb7db7ce34bb6c6fd448b270e7c8472478af1338d6438","observation_id":"2e9fe91c-3242-4a7e-84de-3a088856acb2","resolution":{"observed_at":"2026-08-06T17:58:27.497281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T17:58:27.574010Z","title":"arXiv preprint arXiv:2311.10122","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.574010Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:8926b20b68bdd01c22aa8a802df5e692558115c86442b74852e753dc07551c50","observation_id":"12d3c181-6b2b-48f5-9a19-2e74dab9d8b7","resolution":{"observed_at":"2026-08-06T17:58:27.574010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T17:58:27.664978Z","title":"arXiv preprint arXiv:2306.05424","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.664978Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:acb512d6e917473d3c6d656b4314c1cecd122c2405a3883b04c260443e9e184d","observation_id":"29e4b54c-e510-4e57-a49e-06d18a014e81","resolution":{"observed_at":"2026-08-06T17:58:27.664978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-06T17:58:27.742728Z","title":"arXiv preprint arXiv:2311.16103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.742728Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:da678512537116f8be77f62fb28b4de044639e8e03e6813b4b1ff615bb5ad4b3","observation_id":"e3afeb3f-c265-4265-b6d6-c827bc88199f","resolution":{"observed_at":"2026-08-06T17:58:27.742728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T17:58:27.869001Z","title":"arXiv preprint arXiv:2307.01952","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.869001Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:0e5a75dcec2efcad9234ef234738ece2dabe9c4b2f3773a12c17597d59666c64","observation_id":"6bae6f8d-83e3-4ed8-bd95-2e4eb9a51a04","resolution":{"observed_at":"2026-08-06T17:58:27.869001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T17:58:28.048573Z","title":"arXiv preprint arXiv:2312.11805","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.048573Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:7912bd336ac9fb0ebc1f70cba3893f044f69f1bcd87fcdfd2e216d821bfcf5cf","observation_id":"6a1d268b-9279-4f76-b196-2ea10c60c1ac","resolution":{"observed_at":"2026-08-06T17:58:28.048573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:58:28.123501Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.123501Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:44c4101729cbe048b7747b913177bea8b6849dbc437ba032f9486654cf2e08aa","observation_id":"0df38b9a-421b-4c41-bce0-512fefeb66ad","resolution":{"observed_at":"2026-08-06T17:58:28.123501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:58:28.210161Z","title":"arXiv preprint arXiv:2302.13971","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.210161Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:e1f2f03a49de3d678ff3faca5cffe8fb5eb503ffbc9965fef0d78efe81dd96ef","observation_id":"9690be43-8fa6-4a16-8d82-8cfc3cee34b6","resolution":{"observed_at":"2026-08-06T17:58:28.210161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T17:58:28.290683Z","title":"arXiv preprint arXiv:2404.16994","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.290683Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:3734ed24826fc74b336f61dd45b907dce045a32e6b92c5e2cdaeebfd5a9a6786","observation_id":"5bc9de2a-5ae8-4fba-a9dd-d6a1ad4f60d7","resolution":{"observed_at":"2026-08-06T17:58:28.290683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T17:58:28.410060Z","title":"arXiv preprint arXiv:2304.14178","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.410060Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:0e0c0a9492e89cf9074a791916b04e5d03dc65bbc98e562c5bbe1d6c642ce603","observation_id":"f38c72b6-ab00-48f1-9357-6ad9026aae26","resolution":{"observed_at":"2026-08-06T17:58:28.410060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T17:58:28.607448Z","title":"arXiv preprint arXiv:2306.02858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.607448Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:1b54a3dc447d196545b70b8bfa3da055f7ff064f76ebc4734b138805ab795e45","observation_id":"c90621e8-d91b-4dfa-bc18-bf43b47f0302","resolution":{"observed_at":"2026-08-06T17:58:28.607448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-07-30T21:22:18.339303Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-06T17:58:28.693651Z","title":"arXiv preprint arXiv:2405.14622","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.693651Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:a00986e6d15fd9da70aaa8ca821cb280e05e8ddf8e31433323d29c1573ed121a","observation_id":"cee639af-b059-46b5-a330-3c58a5c54f4c","resolution":{"observed_at":"2026-08-06T17:58:28.693651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T17:58:28.781308Z","title":"{original_question}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.781308Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:3dabe33f831e181421646fbd7f32958131e35af03bdaeb5b282d5cd893eb317c","observation_id":"7185eb2e-ce12-4469-a11e-d8a45750ae99","resolution":{"observed_at":"2026-08-06T17:58:28.781308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:58:26.922661Z","title":"arXiv preprint arXiv:2308.12966","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:26.922661Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:635e7139122e171c6ee5af269fad73a8067640f60f90c0fbfb51e0317187a973","observation_id":"51d4fdf8-37b1-40a6-99de-acddef1db62f","resolution":{"observed_at":"2026-08-06T17:58:26.922661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T17:58:26.999928Z","title":"arXiv preprint arXiv:2410.10818","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:26.999928Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:4d51d9e8eaad3c3a5889e83a34194e15a4aed76ab2c4aa785d4188e9c1c62aeb","observation_id":"bbe643d1-35b2-4d2e-9e1a-e0b64b67fc02","resolution":{"observed_at":"2026-08-06T17:58:26.999928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-08-07T18:11:33.842031Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-06T17:58:28.549081Z","title":"arXiv preprint arXiv:2502.12081","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:28.549081Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:f6ca784c6bb6a39b7e930ebf6e36fe068b59b5281d2d9cb60abf6c29668d3eab","observation_id":"1ab8663f-6b5a-4105-a085-03e570d9dc04","resolution":{"observed_at":"2026-08-06T17:58:28.549081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 3 inbound Pith citation observations for arXiv:2507.09491."}