{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e83b5266b79df9b886f3a32e8e251ec1f771a686857093e6be2fdefb0d20012","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:52:35.700887Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:49:50.117587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:58:02.808545Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-08-05T19:03:06.002557Z","title":"Mmr-v: What’s left unsaid? a benchmark for multimodal deep reasoning in videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:06.002557Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:9a7b6b18ad34e8c4dbe61ed339fa52ef524892622ff6fb858eb63851f39bb55b","observation_id":"ebecd022-1635-4ac0-9adf-90481d7d2c4f","resolution":{"observed_at":"2026-08-05T19:03:06.002557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":"2506.04141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-07-21T02:21:18.406523Z","title":"Mmr-v: What’s left unsaid? a benchmark for multimodal deep reasoning in videos","venue":null,"work_id":"8b0cba3a-c8ac-4aed-99dc-f2f9f6dfdca4","year":2025},"citing_paper":{"arxiv_id":"2605.21988","last_updated":"2026-05-21T04:38:02Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T04:38:02Z","title":"Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:56.473188Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2605.21988"},"observation_digest":"sha256:963fca846b68c7f6bdabb9e19f5fc5e7ebd4995a38bbf9ab9232516302cf2a05","observation_id":"8fbfc4d0-759f-413e-a6ea-d4098a5fdc1f","resolution":{"observed_at":"2026-07-21T02:21:18.406523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":"2506.04141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-07-21T02:21:18.406523Z","title":"Mmr-v: What’s left unsaid? a benchmark for multimodal deep reasoning in videos","venue":null,"work_id":"8b0cba3a-c8ac-4aed-99dc-f2f9f6dfdca4","year":2025},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:3c00d55e8a76fc8e6008630a704407e9849cdcf456dbd985ea2c24b16f87ba5b","observation_id":"891718a3-8afd-4116-abda-c9c01826bc0c","resolution":{"observed_at":"2026-07-21T02:21:18.406523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04141","snapshot_observed_at":"2026-08-08T00:49:50.117587Z","title":"Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, and Jun Zhao","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03571","last_updated":"2026-08-06T02:46:18Z","snapshot_observed_at":"2026-08-09T23:10:07.227347Z","submitted_at":"2026-08-04T12:32:18Z","title":"Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T00:49:50.117587Z"},"links":{"cited_paper":"/paper/2506.04141","citing_paper":"/paper/2608.03571"},"observation_digest":"sha256:42985a4b505702db2441aecd97baa90605ae1baa42e94ea719cb73989b04f2a3","observation_id":"fc22239d-0da1-49c1-b065-5cfddb0ec259","resolution":{"observed_at":"2026-08-08T00:49:50.117587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04141/citation-record","integrity":"/paper/2506.04141/integrity","json":"/paper/2506.04141/citation-record.json","paper":"/paper/2506.04141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:52:35.535059Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.535059Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:061313353197684a86142888556f0a4cf0d38dfdb38573808515e55bb66c23b3","observation_id":"8a16a489-26ec-4e1d-855e-a27405a9f5aa","resolution":{"observed_at":"2026-08-07T10:52:35.535059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:52:35.539038Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.539038Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e57710da0e9f66c5ae79de4007f129a9ae8431a111b8a0ef2d6d6708abeb2d87","observation_id":"608af6c8-5391-47ea-883a-49f3e032d898","resolution":{"observed_at":"2026-08-07T10:52:35.539038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T10:52:35.542436Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.542436Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:03155af9f0c4d54718350581d0139ab06620b1c0594279abce8b889f9b9fc043","observation_id":"696125e8-28f7-4289-bcdf-0cc6e607d783","resolution":{"observed_at":"2026-08-07T10:52:35.542436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.181955Z","title":"Openai: Introducing openai o3 and o4-mini,","venue":null,"work_id":"f92e8513-c483-468a-b263-1d305a97fb76","year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.546254Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:47be1c5a9c1186fb7cb58ec32dab8e58af78b20a7f421cf3389f4833f30d2fa6","observation_id":"2837dcb6-1fc7-4490-a770-0340dcad625f","resolution":{"observed_at":"2026-08-07T10:52:36.184407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.174458Z","title":"Research of intelligent home secu- rity surveillance system based on zigbee,","venue":null,"work_id":"2d54d6d0-3da0-41e9-a96c-0bc679bbf619","year":2008},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.549199Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:a7ecdec1f3c5eaaceaf6c6d3b0fd1c25562913c2f4e5a2589f68dd5db75fc4a1","observation_id":"38117a36-c7c9-48b2-92fb-2433210e2447","resolution":{"observed_at":"2026-08-07T10:52:36.177611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T10:52:35.551878Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.551878Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:3f170b210a9074ee2523e30679e90981bbcc8d04f6858fd577806ba3d16d3656","observation_id":"8da11fa4-00ac-49d7-8db0-bbc9bafe1b09","resolution":{"observed_at":"2026-08-07T10:52:35.551878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T10:52:35.554510Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.554510Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e2ae00027843eb8b8f22e34069ff2c005f10596882a736f29f64ee60fbab032b","observation_id":"c289e8f2-a3dc-4736-8ed1-02d23e992757","resolution":{"observed_at":"2026-08-07T10:52:35.554510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:52:35.557682Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.557682Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:64413fa37861bc75ca6be6eb64c365f4bb68ca2dc1b5dcf2b42b14192186b50b","observation_id":"f326eb43-54e8-478d-9c96-d0d02bd77ea7","resolution":{"observed_at":"2026-08-07T10:52:35.557682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.560026Z","title":"Heuristic and analytic processes in reasoning,","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.560026Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f6e939f939d40a443c0b23589720a859728583fa5d977c0b3e4d9adba51cc2ab","observation_id":"815ece1e-e41f-4d65-99ae-0595086be7c3","resolution":{"observed_at":"2026-08-07T10:52:35.560026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.164512Z","title":"The clarion cognitive architecture: Extending cognitive modeling to social simulation,","venue":null,"work_id":"4261f5e6-5bb5-4ef9-9838-19a9a2579a71","year":2006},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.562565Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:008baad9d83a4fee26e8d63d03bfde27db4c91cacfad49fb45851071c08385bd","observation_id":"e7a147bf-5864-4e56-b4ec-38a7aed68782","resolution":{"observed_at":"2026-08-07T10:52:36.167076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.158067Z","title":"Polanyi, Personal knowledge","venue":null,"work_id":"17821007-588e-473d-b9e6-3ab5c92ac96a","year":2012},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.565002Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:339cde5a174d65a375522a8ee8031a1daf84e6bcd7c2546e601b88e9d3778d2b","observation_id":"5b9c24f5-db67-4ecf-a81b-62c1009f6fa6","resolution":{"observed_at":"2026-08-07T10:52:36.160499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.150570Z","title":"Kahneman, Thinking, fast and slow","venue":null,"work_id":"7f001cc7-7fb3-4f47-8b71-3827ab4bf7ec","year":2011},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.568284Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f26728fca6f591d6adf28d155dc9c5d4841080aff2128be85062b72cc21e0e30","observation_id":"4dda2206-841f-4a8c-b824-b2ec497eb91e","resolution":{"observed_at":"2026-08-07T10:52:36.153382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T10:52:35.570857Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.570857Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:0ab0a8ccab6034c75a77624347ad924bb2af49fa26713badd3de521e054ca097","observation_id":"754fa109-f05c-449f-a839-53549b917c38","resolution":{"observed_at":"2026-08-07T10:52:35.570857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.142477Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset,","venue":null,"work_id":"bbad5fa7-bd47-4446-8e85-2e00887a3010","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.573771Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:1b03febddf90e4a3f371a17c24e22d6e79fc9fb4e75f8f10231c9158360e6261","observation_id":"3ae94a2c-6515-4e47-baf9-9371e5a6adfb","resolution":{"observed_at":"2026-08-07T10:52:36.145456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12381","last_updated":"2025-02-18T06:00:26Z","snapshot_observed_at":"2026-07-06T19:34:27.813248Z","submitted_at":"2024-10-16T09:04:57Z","title":"HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12381","snapshot_observed_at":"2026-08-07T10:52:35.576700Z","title":"Humaneval-v: Evaluating visual understanding and reasoning abilities of large multimodal models through coding tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.576700Z"},"links":{"cited_paper":"/paper/2410.12381","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:a120457295c878b9e6d6dad51f4e5bed2f617a032fd9a7575ebca914adf7f22a","observation_id":"edb1385a-aa8f-4b6a-a67f-e6175f0dace0","resolution":{"observed_at":"2026-08-07T10:52:35.576700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:52:35.579503Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.579503Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:bee6429c7f57199da837e5ccc14646ac20fccc4f48fa9ad071dc2f03d75f7d66","observation_id":"93c96661-efa9-4687-8115-466c2b575ef9","resolution":{"observed_at":"2026-08-07T10:52:35.579503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.135978Z","title":"Chain-of- thought prompting elicits reasoning in large language models,","venue":null,"work_id":"05046b82-ac85-4291-bc22-70856b58ebf1","year":2022},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.581603Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:a8bde3e06e040603af14fe8d50b719d4fe70f2fd7f12c17565b199131c032a1b","observation_id":"cf43c518-8b97-4078-bcae-45ad4cdfa3ac","resolution":{"observed_at":"2026-08-07T10:52:36.138576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.129375Z","title":"RankGen: Improving text generation with large ranking models,","venue":null,"work_id":"4412c51a-140a-44c8-a45c-ef7b2e6cc594","year":2022},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.584452Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:1e2d1bd79f9d56cd97ab029a6bc08a8f3c3f362a88c61e921bc1b83ef744280e","observation_id":"c4d885aa-7179-4fe9-aecc-6e76ea3d0a9f","resolution":{"observed_at":"2026-08-07T10:52:36.131984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:52:35.588141Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.588141Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:6353283589ff4469861baddb208a4088dc0ee930f9da9cf7ea7e86f12de0276e","observation_id":"15f9f687-6393-4f1b-8cba-3fb5a58c9845","resolution":{"observed_at":"2026-08-07T10:52:35.588141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03690","last_updated":"2024-05-08T19:46:35Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:59:45Z","title":"How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03690","snapshot_observed_at":"2026-08-07T10:52:35.590859Z","title":"How good is my video lmm? complex video reasoning and robustness evaluation suite for video-lmms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.590859Z"},"links":{"cited_paper":"/paper/2405.03690","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:5872af2bb6f9754d7dabd703b89ee2e66e33ad7370c9e7156bdb7b9a033a7d8f","observation_id":"dce1fa4e-302d-44ff-887f-749bc44c8912","resolution":{"observed_at":"2026-08-07T10:52:35.590859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.119922Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":"400986c4-b5e0-43cb-977b-8e826009d1c3","year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.593755Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:deecba4c6adea08b93d1c8cc45df56a54f2ea8df809c0a4150ee15cab17b417d","observation_id":"cb9b44b8-3b68-46e1-ad0f-119a3b6d46e6","resolution":{"observed_at":"2026-08-07T10:52:36.123300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.111443Z","title":"Perception test: A diagnostic benchmark for multimodal video models,","venue":null,"work_id":"bd3ab69c-4d20-459b-a883-2eda457fafde","year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.597811Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f751ca0969b6ccc6fcfc5331d8f7d26f74af8edfd9f857cc380aeeea7e201d17","observation_id":"8b7b15e2-7b1c-43da-b22d-6946373d3fa3","resolution":{"observed_at":"2026-08-07T10:52:36.114394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.105046Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"1a8ab66a-903d-44d5-a295-e04c69949c76","year":2021},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.600619Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c1ea9a62f9c863b1ce532d8947de76ea2d0add20a92de45c00b2bc934c3ab650","observation_id":"dad58a08-81a7-4ecc-8a96-3cfa5e286a49","resolution":{"observed_at":"2026-08-07T10:52:36.107625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.097154Z","title":"Video question answering via gradually refined attention over appearance and motion,","venue":null,"work_id":"3439b6c6-a2d0-46de-95ef-ed701a0ab8e7","year":2017},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.602947Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c727359a506d02306fc411cf7aefbf3859db5550faf81bd84d207e902dac523f","observation_id":"1e68601b-13b4-4b2b-b48c-1e5b8d02d133","resolution":{"observed_at":"2026-08-07T10:52:36.099703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.090651Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"6f2d67eb-183d-40b7-ae54-fe7a20255b68","year":2016},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.605131Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:09375699c25ae93530c4d892fb06870110c68d05a0293ce16d0e3a586edde51a","observation_id":"6009dc50-9be6-4b74-99c0-4c2b46d98e3a","resolution":{"observed_at":"2026-08-07T10:52:36.093405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.084043Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"b6cf55a6-303b-4351-94a2-e1476447676e","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.608093Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:be77e963d5450416b00681b8468bf310da8891e158e33317e4252b7dfc4760db","observation_id":"265751a1-b2e7-4379-ad90-d3336e43c38c","resolution":{"observed_at":"2026-08-07T10:52:36.086512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.076246Z","title":"Mmbench-video: A long- form multi-shot benchmark for holistic video understanding,","venue":null,"work_id":"f8f8ba5f-2ddf-440d-80d0-a323b82ca7ad","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.610522Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2b53b94240c33ac457ea626f640265c90db9afa2b3b7a29312cee42a42cf99ca","observation_id":"ba051163-bcca-49a4-83cb-e9ca4aaf9e11","resolution":{"observed_at":"2026-08-07T10:52:36.078924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T10:52:35.612961Z","title":"Lvbench: An extreme long video understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.612961Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c03cd502f23d384ba32b400f33fa5d493aa76a312d1cbd0ec940de57ffae46d8","observation_id":"8e1d8bd8-16f3-4858-b9d9-64466ebf18c2","resolution":{"observed_at":"2026-08-07T10:52:35.612961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.066119Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding,","venue":null,"work_id":"9bd67522-7ade-4041-be87-cf457aac8b75","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.615998Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:bfff0a09106d237be05c1685fbb1f76b63957ea95151b3611b668f99eb1ab8ba","observation_id":"2c07c50b-6b93-43ff-b0bc-7924086641cc","resolution":{"observed_at":"2026-08-07T10:52:36.069252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T10:52:35.618681Z","title":"Kimi k1. 5: Scaling reinforcement learning with llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.618681Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:4d5543f265c4293807fe9fc9cb17e90aa6c8af66f13da73214d2bb5c8847464d","observation_id":"2bd4f8df-af75-426c-b290-f519c8a333c5","resolution":{"observed_at":"2026-08-07T10:52:35.618681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14405","last_updated":"2024-11-25T17:57:55Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:37:33Z","title":"Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14405","snapshot_observed_at":"2026-08-07T10:52:35.621054Z","title":"Marco-o1: Towards open reasoning models for open-ended solutions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.621054Z"},"links":{"cited_paper":"/paper/2411.14405","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:c40324cfdeb4c62bb17ce01c11ea8f8c08994a2303767ab06d18f328b520ff5d","observation_id":"f4a9f28e-6d68-490d-9c0a-b92f8113a146","resolution":{"observed_at":"2026-08-07T10:52:35.621054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T10:52:35.623579Z","title":"Measuring mathematical problem solving with the math dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.623579Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:01e453cebd0703513063f53240aac733e2d12579621273ad26b20f2957c650af","observation_id":"7477edea-e870-43d3-a06e-bbb798c429b6","resolution":{"observed_at":"2026-08-07T10:52:35.623579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-04T21:07:04.238345Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-08-07T10:52:35.626941Z","title":"Long- bench v2: Towards deeper understanding and reasoning on realistic long-context multitasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.626941Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:acb8b8e4bd8f8074d3e30a807a32472cb6ca3330049c26d14691e15b823089df","observation_id":"4bf18601-602f-438b-9b73-a25056ed88bb","resolution":{"observed_at":"2026-08-07T10:52:35.626941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:52:35.629166Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.629166Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:b17a696ed32c3ddde2fa12345554ee4cc82ce057c957d13cc9f39798dfa5967f","observation_id":"6307fcba-3259-4113-84d5-d4ccd70da711","resolution":{"observed_at":"2026-08-07T10:52:35.629166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.056530Z","title":"Gpqa: A graduate-level google-proof q&a benchmark,","venue":null,"work_id":"5d885ec8-6b42-4daa-8176-f12dfee31e61","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.631579Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:3d3f687135f50aca283a0b626ae1ade1fd7b563f46a63c4b05b595e57d3ac356","observation_id":"5b806217-6fdf-455b-a7f3-ea38eaebe4f7","resolution":{"observed_at":"2026-08-07T10:52:36.059415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.049995Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding bench- mark,","venue":null,"work_id":"88d935db-0566-48fd-b83f-10c925adab7d","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.634582Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e598b6a8a35e2f3ac4526989104375c6f72352e61644b3085422f1c4a841c464","observation_id":"4896c574-0961-4e46-98b0-c87fd72cb4c2","resolution":{"observed_at":"2026-08-07T10:52:36.052675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T10:52:35.637054Z","title":"Swe-bench: Can language models resolve real-world github issues?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.637054Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:23853fddd5a24488ffff06bda8161ceabaf03a1ac031852ab0cfb4c3c53e1d1e","observation_id":"223354ca-41cd-4172-a936-0abf93f001f4","resolution":{"observed_at":"2026-08-07T10:52:35.637054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-08T00:41:26.316141Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-07T10:52:35.639817Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.639817Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:b0a302be031e2dba49dfc8cddebdae6a100edf62c08719d98242d3e08119f412","observation_id":"dc10fc38-d2e6-452b-a61b-36f266a4b83d","resolution":{"observed_at":"2026-08-07T10:52:35.639817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-07T10:52:35.642571Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.642571Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:f30292b325b8ae6fa387eabf5cedda9a7108309875786ec7cbc32619720aa2d7","observation_id":"0552af4a-974a-47da-b9ed-a3540cec5b83","resolution":{"observed_at":"2026-08-07T10:52:35.642571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.041709Z","title":"Lakoff and M","venue":null,"work_id":"9b00c59a-42b1-41e4-bd34-8aa9be5c29af","year":2008},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.645908Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2429df7ab2a9ff0168a6a0b8c6d4ea82f9e3a2b19c15aa2d5f66ba5499e8d80c","observation_id":"104ac23d-bed3-4f46-9dea-a9c5e2e4580a","resolution":{"observed_at":"2026-08-07T10:52:36.045708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.032508Z","title":"Openai: Hello gpt-4o,","venue":null,"work_id":"92d105e3-ae72-42b0-a1aa-5e8877fc10b0","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.648604Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:8042289808858f430204211a71681814dff02bca912994077e7abe2aec33b6a5","observation_id":"d56947e7-039f-4d09-8949-cd08332cc74c","resolution":{"observed_at":"2026-08-07T10:52:36.036018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.023745Z","title":"Gpt-4o mini: advancing cost-efficient intelligence,","venue":null,"work_id":"6b612fa1-819f-42cd-a3b8-6666375e930e","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.651452Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:72fb2cc7fb26ef687d21f9980d7e4d748c25f22c8e8b3d8602e2304278960aee","observation_id":"2bc0ecf3-0ec5-4795-a9e5-1282987a84d9","resolution":{"observed_at":"2026-08-07T10:52:36.027076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.011951Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"f27e69ce-3155-408c-a9d3-7c495fe51181","year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.654068Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:92667aedd5519dd5c8402da15f005defc0926e2f6707f9bf3a169d6befc9e17c","observation_id":"ab86d69c-cbb5-4932-bd99-16234070d577","resolution":{"observed_at":"2026-08-07T10:52:36.015045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:52:35.656456Z","title":"Gemini 1.5: Unlocking multimodal understand- ing across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.656456Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:09dcc1135312e90d850bce2cd9c96aad924801453764a25cd247d2aabb18d4b6","observation_id":"6d61bee7-0ec2-430a-aad2-eeca0b8af9a6","resolution":{"observed_at":"2026-08-07T10:52:35.656456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:36.003421Z","title":"Gemini 2.5: Our most intelligent ai model,","venue":null,"work_id":"c4bcd98d-7a61-478e-a2a4-b7d28de841e1","year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.658759Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:b2760dabcc566eff8bb5c17ba28c724c3424438b7e7dda70fa1c570b60590737","observation_id":"58c4fed6-ce9d-495a-ba14-8d44dec453b5","resolution":{"observed_at":"2026-08-07T10:52:36.006568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.994237Z","title":"Anthropic: Introducing claude 3.5 sonnet,","venue":null,"work_id":"cdce3a81-4252-4750-9ed2-0d97bb9caae1","year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.661183Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:d6ca23a36d6086e5436033496429bfe6531872f05c08149870396e117f9513b5","observation_id":"a769eb1e-f719-45da-b3a6-30b59e601754","resolution":{"observed_at":"2026-08-07T10:52:35.997341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:52:35.663611Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.663611Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:58e05c19712ad86a01b3b933b546b90b422c8bdd734dad83ea5ef9e0f9fd3975","observation_id":"d5c5ea53-26e1-4b1b-8981-707069f2b507","resolution":{"observed_at":"2026-08-07T10:52:35.663611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T10:52:35.666040Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.666040Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:e233c49d233fed1eaa6d57f982595890b579acff50b99121d179367bc8609f04","observation_id":"11546b1a-8c4d-4240-8fc3-7a2426ff067a","resolution":{"observed_at":"2026-08-07T10:52:35.666040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:52:35.668975Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.668975Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:bb2dcc4c6d896854b8a014c27dafc8510686f4d797466bc286aec23da7681ce4","observation_id":"a93883e8-83a9-4a11-ac5c-a00642dd05e3","resolution":{"observed_at":"2026-08-07T10:52:35.668975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:52:35.671480Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.671480Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:cac46d65b34362ab68dd476ca3b20d5ba04e377524109c12c65ce859a3c5084a","observation_id":"d38a5394-b012-47c9-bd6a-84ce83e0ae64","resolution":{"observed_at":"2026-08-07T10:52:35.671480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:52:35.674042Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.674042Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:28aec80a84a06bb76a205bc0c1f4e7e49ac4777f9b2d32d56b9c616773b0f76f","observation_id":"de3a22ae-1e91-4360-9657-788ee22deb90","resolution":{"observed_at":"2026-08-07T10:52:35.674042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T10:52:35.677159Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.677159Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:d80b398c5ff049dfa4ca10fbb3a403971b5e30da31c4dbac63220e12bbf79ad7","observation_id":"fe7b0446-b8e9-499f-8209-0ad8c96a9e49","resolution":{"observed_at":"2026-08-07T10:52:35.677159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:52:35.680171Z","title":"Cogvlm2: Visual language models for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.680171Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2d2ee58cdad58d1a92fa198c19b39102ce031a42c2881b7dbd1ef88571f43637","observation_id":"54be0b75-8e85-4d36-95de-86a8a0f15c25","resolution":{"observed_at":"2026-08-07T10:52:35.680171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T10:52:35.682714Z","title":"Nvila: Efficient frontier visual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.682714Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:121a5a4b100bd753209281d7c62e53ad80b264c48865d02be038e8112e94eb38","observation_id":"56673960-7564-4da5-a3a2-2610c81da451","resolution":{"observed_at":"2026-08-07T10:52:35.682714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.985037Z","title":"Watch the video and answer the question and give a correct answer","venue":null,"work_id":"e15e7ac7-587f-4607-ad27-66ede62348fa","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.686243Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:ca67fc8678275a2d6870664da1fbbbce066f0aa949f256ad3c34802f71d889bf","observation_id":"df71c6de-2a7d-4d99-9116-a1fef8e437d4","resolution":{"observed_at":"2026-08-07T10:52:35.988996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.976932Z","title":"High recognition interpretation?","venue":null,"work_id":"8998d8d0-a330-43ef-a654-ac443b145846","year":2023},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.688938Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:5fb96a66974188fc388118fd5fb57677260da65d881c68da6513edb3dfe84ce0","observation_id":"43116a44-f79e-4edc-bdf0-8526975beadd","resolution":{"observed_at":"2026-08-07T10:52:35.979480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.968675Z","title":null,"venue":null,"work_id":"f49d76f6-2577-4406-8104-f1f25488cda1","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.692710Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:1174a38addf84c2ca50cc459292a795e21799037662e6c2e6df345ad49f45cd9","observation_id":"63ef1949-7e76-46d4-8d45-d312edc68e67","resolution":{"observed_at":"2026-08-07T10:52:35.971576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.959921Z","title":null,"venue":null,"work_id":"dc222760-7a1e-4f08-9939-83546c18f277","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.695310Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:2dd6230cf3a5b25b2e9cf7f9364728569b359ac620c1fa943f25b18786673821","observation_id":"082f057b-d313-4e56-b086-1fb4e4699f0c","resolution":{"observed_at":"2026-08-07T10:52:35.962889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.951350Z","title":null,"venue":null,"work_id":"ecc52a64-514d-4d2e-b0cc-153eb23fcf9a","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.698314Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:3c0c1a2c07e0137bb1c3a303c069503de1fd43056964bfff155ad3933aa131e8","observation_id":"743b6930-a177-4b7a-8ec4-30b559a41c74","resolution":{"observed_at":"2026-08-07T10:52:35.954443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:35.937520Z","title":"other frame desc","venue":null,"work_id":"36852488-42e2-4a00-8116-fe588adb7e8f","year":null},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.700887Z"},"links":{"citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:505a2d3ec520bd24067992815c1edd506b7cd99963a252a94d8de34a069b0a6e","observation_id":"311c2a08-1cf8-4df3-b88d-180c1aff6595","resolution":{"observed_at":"2026-08-07T10:52:35.940971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 4 inbound Pith citation observations for arXiv:2506.04141."}