{"as_of":"2026-08-10T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e406f28e17463b4ad9435a664b2163453de1b367463c0d5d9c4b818dc4898e3","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:27:36.485905Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T12:10:52.100410Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07680","snapshot_observed_at":"2026-07-11T12:10:52.100410Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04872","last_updated":"2026-07-06T09:47:23Z","snapshot_observed_at":"2026-08-09T06:09:59.502332Z","submitted_at":"2026-07-06T09:47:23Z","title":"EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-11T12:10:52.100410Z"},"links":{"cited_paper":"/paper/2509.07680","citing_paper":"/paper/2607.04872"},"observation_digest":"sha256:0d1165febb38540a44617b9515ef43671ab554794b167a455159759c03bd5263","observation_id":"8c9e2c2c-f4c5-4319-9144-045b73a1fd8c","resolution":{"observed_at":"2026-07-11T12:10:52.100410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.07680/citation-record","integrity":"/paper/2509.07680/integrity","json":"/paper/2509.07680/citation-record.json","paper":"/paper/2509.07680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:33.487697Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.487697Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:9ffb627f8691bfc86990c52ed3fcf8a49be21ced498f02e2edca7f671cb13a99","observation_id":"049fe0d7-f676-4ee8-a644-fb49a454e9c4","resolution":{"observed_at":"2026-08-04T21:27:33.487697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:39.433148Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"98c82fc1-54b4-417b-aa9e-fa3604443ba0","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.532164Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:31469978071f0a562a93c2106c69b46f823b369a1db749b490cf4a4f415c0a1e","observation_id":"b25f5195-6d7e-4ad1-828a-26e7aa2bef37","resolution":{"observed_at":"2026-08-04T21:27:39.555502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:39.179261Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"bbe09684-eca1-4443-9c2f-aa06b8e08199","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.685027Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:fc6618dfb563daedce6ac10ef3a3ef15c1ba67c9f70b6737ccc48fae4557e26a","observation_id":"eb4beec8-12f7-4875-8dcd-ff4ba7c6fc2d","resolution":{"observed_at":"2026-08-04T21:27:39.282949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17235","last_updated":"2024-10-10T05:17:00Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T18:58:01Z","title":"A Simple LLM Framework for Long-Range Video Question-Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17235","snapshot_observed_at":"2026-08-04T21:27:33.767446Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.767446Z"},"links":{"cited_paper":"/paper/2312.17235","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:01ceea0896e08d809a6aa3ffbaba3f889d3ae173639aa5bf854aef5f26f66456","observation_id":"4c6df0f6-e239-4eee-b50c-4bf0e9b1d78f","resolution":{"observed_at":"2026-08-04T21:27:33.767446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T21:27:33.848649Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.848649Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:79d9f88e7576d7e5a15d2b5b0bcc61e7e0da2e122c951da77496474a9ca2ba9a","observation_id":"cbf5aef3-9f65-4bac-b025-27198498e1e4","resolution":{"observed_at":"2026-08-04T21:27:33.848649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-04T21:27:33.916746Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.916746Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:e4fc481cf834ce4f839b0664c18ab98f3937dfc62a8a6ab124fa9378f31d93e6","observation_id":"23865ffd-44b1-412e-9dd3-e5d1537515b8","resolution":{"observed_at":"2026-08-04T21:27:33.916746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-04T21:27:33.985149Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:33.985149Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:9377ce2220e786cd25ef6f51a13afafc3e5bb39aaaac28bd64d4be1ef112ac49","observation_id":"f014ec7f-807a-4c89-9dce-1e96c8687105","resolution":{"observed_at":"2026-08-04T21:27:33.985149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:34.023884Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.023884Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:9ec86dafc16a2702e85784b0582782ce07aad428a5395feaf6dafe4bfbf26385","observation_id":"3e73f29b-c5a7-439b-93ef-64ed5b7c8f48","resolution":{"observed_at":"2026-08-04T21:27:34.023884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T21:27:34.093889Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.093889Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:81f3b2c750751f97aca9422c22904b8bf495460587fd9796146bcf933e86822d","observation_id":"d3df2e3e-85dc-41b4-b9d9-24229e70ff67","resolution":{"observed_at":"2026-08-04T21:27:34.093889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:39.029194Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":"8d2773bb-0055-40c9-86c2-09c357ee1e7c","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.162507Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:cb4df469a4b67364df0415905725da4666a6521b52134c5b2b3119e0928a3c1a","observation_id":"c6da55a7-b82c-4eb5-8146-49450b656c1a","resolution":{"observed_at":"2026-08-04T21:27:39.076824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-07-06T17:28:02.037844Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-04T21:27:34.250664Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.250664Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:d271e6fef471a239bb8d201a49a327dbd9fe3dad44bb2af33a7bcb18df0d7f49","observation_id":"716ce33e-8ff0-40c2-9706-7aa442423d74","resolution":{"observed_at":"2026-08-04T21:27:34.250664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:38.714262Z","title":"Avis: Autonomous visual information seeking with large language model agent","venue":null,"work_id":"bc703f41-e4ea-44b7-bd3b-79be28f6ed9e","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.344479Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:5335f9f49000359b150244d9460e1279a415378b39e5f9788f9a33fd415b12cf","observation_id":"71085a8d-143a-4a89-a7f0-7ae194f3080f","resolution":{"observed_at":"2026-08-04T21:27:38.815122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:38.450098Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"e44c04a0-bd96-4366-91b6-61824b534392","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.432709Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:cdc11d7b1adf1665b5ec63ffd72abe3287dd5e5b143209af5c350aadbc205288","observation_id":"95a9f6aa-4510-4836-bd13-cebc99fc83d3","resolution":{"observed_at":"2026-08-04T21:27:38.562817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-04T21:27:34.505356Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.505356Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:b6a4dd9b17057380a645cea25c5b0287394628048d69c5426e6df8e0c9d76b36","observation_id":"3eec420b-cac0-4f66-8a0f-3c9e2c41339a","resolution":{"observed_at":"2026-08-04T21:27:34.505356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T21:27:34.584209Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.584209Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:2a56d4188a07ab2351256ffa9e79d7012ed1a1f7a108ab87a3893618c865cfda","observation_id":"95e4685d-f480-447b-a7b7-9fa7fc7b395f","resolution":{"observed_at":"2026-08-04T21:27:34.584209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:38.130964Z","title":"Inferring and executing programs for visual reasoning","venue":null,"work_id":"ca5636f4-c3a5-4801-8df8-ae2f50b44b89","year":2017},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.663781Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:f8d7fbe37523ea4762f2b936180dddc68cd4205f3e71730a219fd8dd011f1bd8","observation_id":"50ef2bbd-3407-46a4-9341-3bbdc84bbcb1","resolution":{"observed_at":"2026-08-04T21:27:38.217645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:34.720565Z","title":"When can llms actually correct their own mistakes? a critical survey of self-correction of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.720565Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:5d1901ff77cc77ac09203394fa1e2ed9bb051a9cdb83f51d757041a63c8a0792","observation_id":"023c8a3d-9bce-4b6a-a381-2ccb8e96d831","resolution":{"observed_at":"2026-08-04T21:27:34.720565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06411","last_updated":"2023-11-10T22:14:26Z","snapshot_observed_at":"2026-08-05T10:52:53.465679Z","submitted_at":"2023-11-10T22:14:26Z","title":"Analyzing Modular Approaches for Visual Question Decomposition","version":1},"cited_work":{"arxiv_id":"2311.06411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.06411","snapshot_observed_at":"2026-08-04T21:27:36.697980Z","title":"Analyzing Modular Approaches for Visual Question Decomposition","venue":"cs.CV","work_id":"f28e505f-d177-456f-9d41-b7e7d41466b3","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.772715Z"},"links":{"cited_paper":"/paper/2311.06411","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:946c2c8824275bcb603bb06b7520f4a048cca417797e91ae94609431a00a2a87","observation_id":"5541fcc5-e5a6-4d80-9f2f-79a137d62e86","resolution":{"observed_at":"2026-08-04T21:27:36.771441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T21:27:34.850328Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.850328Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:8598506ae88c1b55624d622ee696b53c4c81b365d2c923f286e31fe9e081d9d4","observation_id":"99d14adb-1b33-4738-b1ac-f9cad089bc02","resolution":{"observed_at":"2026-08-04T21:27:34.850328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:34.906290Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.906290Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:99f14f3687df8f0e1699608203f8365f5fc4bf798e7ff75c225315e6d7c5ddfd","observation_id":"b74080bd-de62-4cc1-a0af-725f2ad4bb48","resolution":{"observed_at":"2026-08-04T21:27:34.906290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-04T21:27:34.988625Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:34.988625Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:19bdf72787282682c9b9eff0adc210c4f0c0e1c6f122f62643f7a8dba20dcc2b","observation_id":"9faf2417-4896-46ee-9883-69e0bdcc3e56","resolution":{"observed_at":"2026-08-04T21:27:34.988625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.810532Z","title":"Morevqa: Exploring modular reasoning models for video question answering","venue":null,"work_id":"5bd99acf-b2fd-4c7d-bc67-e30d28bb477c","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.082929Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:3435b339834a310ca59136fbc6987477187e27e0620ce39c207199cc14194cdc","observation_id":"880be053-394e-41c9-ab1e-f23542e56d5c","resolution":{"observed_at":"2026-08-04T21:27:37.924087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09582","last_updated":"2025-01-18T00:52:42Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:54:48Z","title":"Neptune: The Long Orbit to Benchmarking Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09582","snapshot_observed_at":"2026-08-04T21:27:35.156049Z","title":"Neptune: The long orbit to benchmarking long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.156049Z"},"links":{"cited_paper":"/paper/2412.09582","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:b97c24564f5e8e0c2bb7e4fb95635bfba721fb6b0e671e96c9764cdbffe1d7a1","observation_id":"63d47165-15d3-4cd5-91aa-91e43c1180a2","resolution":{"observed_at":"2026-08-04T21:27:35.156049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T21:27:35.240767Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.240767Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:541f4396b648072774fe24b07b9146a11e76a7103135feb371477e07f3ebf1c8","observation_id":"265e53e3-d135-4834-b8b0-50bf400f7b8d","resolution":{"observed_at":"2026-08-04T21:27:35.240767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.567745Z","title":"Towards truly zero-shot compositional visual reasoning with llms as programmers","venue":null,"work_id":"6edecc88-c502-4500-b014-c29be3074ab1","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.300020Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:8fef503ddd9212e2aca177ac80d1e95f5478b66c9d9847262703f10e3e412208","observation_id":"69a3f923-2596-4a81-87e0-50deecf14655","resolution":{"observed_at":"2026-08-04T21:27:37.693313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.399902Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"0a08387d-a3db-4a31-80ba-3d49465e6d2f","year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.383420Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:3004a0acfd580b03576d467900a73846c8292bd667625c587d99e5899098255f","observation_id":"8a3db425-0d2f-4e69-8bff-727904329d93","resolution":{"observed_at":"2026-08-04T21:27:37.461547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T21:27:35.470462Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.470462Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:5e61cf3b0382721d4d46b723355fb2497d397a29df2f4c89ec09f38e29740eb9","observation_id":"db927cdf-c630-4c20-bc8a-a8182517c755","resolution":{"observed_at":"2026-08-04T21:27:35.470462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T21:27:35.557978Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.557978Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:15471e217476340893246e66903b8440acd36d7cb287b7b4ec93ca073569f588","observation_id":"a690c6b8-d0b8-41e9-96a8-8ebb40ec52a0","resolution":{"observed_at":"2026-08-04T21:27:35.557978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:37.186072Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"faa59a90-ada5-4d76-bdec-16b1b52edc75","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.656988Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:c04f1b79770e466020f00df9d2ab3896d645761a5547743d93dfc1f89f3405c7","observation_id":"586c35f5-5129-415a-8c77-c46ab18dac95","resolution":{"observed_at":"2026-08-04T21:27:37.258238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18272","last_updated":"2024-02-28T12:04:05Z","snapshot_observed_at":"2026-08-09T17:44:03.239380Z","submitted_at":"2024-02-28T12:04:05Z","title":"Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18272","snapshot_observed_at":"2026-08-04T21:27:35.715349Z","title":"Rethinking the bounds of llm reasoning: Are multi-agent discussions the key?, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.715349Z"},"links":{"cited_paper":"/paper/2402.18272","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:b397e73e45e06c28fb50e345d88c7c664a5d14969945cff03290766abe7c727f","observation_id":"bd1bf8a3-3a4b-460c-9550-4b478d18e79d","resolution":{"observed_at":"2026-08-04T21:27:35.715349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:35.764777Z","title":"Cogvlm: Visual expert for pretrained language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.764777Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:1ce6c268b088402d4609853c92f5f9a28d1cc3a2bbfc264681f7687d9f57a0a2","observation_id":"528a6cee-34cb-4c96-8bef-8f2c879b270d","resolution":{"observed_at":"2026-08-04T21:27:35.764777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-04T21:27:35.879398Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.879398Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:00932f78f0173085a1f7eaf30e40df1bef6cf50fe1dee0448dee510fc3c2b4e0","observation_id":"299ce0ad-3cbb-4ac5-853d-24923866c794","resolution":{"observed_at":"2026-08-04T21:27:35.879398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:36.980711Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"c9f1dfef-0143-48e3-8a4b-66c2bfc6cd73","year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.890132Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:41e590ccd586d350a168cd91e1b2253b8b0afbb79d044c8fdde9b8ffe2e747f4","observation_id":"504c5fee-dfba-40a0-a62d-89d70448a760","resolution":{"observed_at":"2026-08-04T21:27:37.058131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-04T21:27:35.899881Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.899881Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:7f8d55ee18d3e420b794d78a70605a1eedad5082a780472c2737a90b2b27d17b","observation_id":"d7f41027-5e6f-4fd2-b83f-dcac4abe59d1","resolution":{"observed_at":"2026-08-04T21:27:35.899881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-04T21:27:35.993623Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:35.993623Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:e77711104d2fdb36756ec1005b3bce5919b4bab4a9f4aebaaa4b82b60cde889f","observation_id":"4feab88e-c7aa-4056-a943-b782fd904b82","resolution":{"observed_at":"2026-08-04T21:27:35.993623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-04T21:27:36.085495Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.085495Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:89c265b321e9943cc01e41f727a8cb507f6241d7eace33bf4fa000568fc959ca","observation_id":"ee04e35f-2e5d-4c03-a0ba-e946184a1057","resolution":{"observed_at":"2026-08-04T21:27:36.085495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:27:36.221921Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.221921Z"},"links":{"citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:db9952d95c839120b44089a676f288f102ebdaff6d36b5cf4c2a8a22ba6cf7f6","observation_id":"1d399245-0291-4f27-94ce-e11d4405cf26","resolution":{"observed_at":"2026-08-04T21:27:36.221921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-04T21:27:36.323801Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.323801Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:280f288b936bb49da242ded55d24b5eaa62112cdb1a5626d841c9839619ae58d","observation_id":"277939ff-dd2b-4604-af9b-c3836914d89b","resolution":{"observed_at":"2026-08-04T21:27:36.323801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T21:27:36.408216Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.408216Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:9cfd830a16baae4b77cc30261e26ede84da3e2f375e28491141575a73632ff22","observation_id":"61073f3f-8553-4916-b6cb-ec7067afd79e","resolution":{"observed_at":"2026-08-04T21:27:36.408216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-06T23:53:10.606737Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-08-04T21:27:36.485905Z","title":"Language agent tree search unifies reasoning acting and planning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T21:27:36.485905Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2509.07680"},"observation_digest":"sha256:c0edd7c07b67c290a78c0b9ba1bfab1e17580f0eae7f5af1d8fb8a1e02f023ac","observation_id":"f0aa01ba-00b7-4a5d-83f6-8b028f9903ae","resolution":{"observed_at":"2026-08-04T21:27:36.485905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.07680","last_updated":"2025-09-09T17:59:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T17:44:26.515281Z","submitted_at":"2025-09-09T17:59:39Z","title":"CAViAR: Critic-Augmented Video Agentic Reasoning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2509.07680."}