{"as_of":"2026-08-20T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:902fa9a047834f01a9aca07dc65f5375bc3d7552b72ae60800371b872de3cd4a","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:55:05.990141Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:12:18.449858Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:49:41.640745Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T00:19:20.462455Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2503.10615"},"observation_digest":"sha256:f22f218b9c8f2524f35cc4f926d8844c512ca17bab014c151a4f3120655bd692","observation_id":"d3d2f3e0-0ea2-4655-82f3-ded6840c9ba8","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-16T05:12:18.449858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-20T10:56:49.638012Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T05:12:18.449858Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2504.21277"},"observation_digest":"sha256:117a7ec796c79383490c95425d4b5dc5349ceb181974b228861b3f89f2e3d18b","observation_id":"6328a92d-895e-4871-86f7-8f7f54284b80","resolution":{"observed_at":"2026-08-16T05:12:18.449858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2505.06698","last_updated":"2026-05-01T06:37:35Z","snapshot_observed_at":"2026-08-05T07:30:33.528415Z","submitted_at":"2025-05-10T16:52:40Z","title":"SCAN: Structured Capability Assessment and Navigation for LLMs","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T16:11:36.613334Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2505.06698"},"observation_digest":"sha256:be63032a047ca1f6cba5d4d1bfdcf7c403e39ffc8f4e9baf0fc12b433ec72c54","observation_id":"34766d48-582d-4b35-a054-ef7c618cf600","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-20T20:37:36.775968Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c8a93187dfd8a9596d7466cb23c8cf28380797ec972e3d1621010683b9734283","observation_id":"e3f32080-9df0-49f2-8ed2-11638ecb1d4e","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-07T14:31:19.618321Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-16T23:13:31.947741Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:19.618321Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:d48e867d232c390ca3be363485d02288032c3ece5b981b4a24c45df03c5399df","observation_id":"85185ae9-fdde-4a62-abc9-5b7fa633c212","resolution":{"observed_at":"2026-08-07T14:31:19.618321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:8e9a31b98c3086dab8a1bdc4e8ab87cdccf1e600c7d0aba7700cb9e139c12fef","observation_id":"72ce693f-81b5-4041-8af2-6027aa1b2613","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-06T20:45:08.961173Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-20T00:00:05.060180Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.961173Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:06c848a1ffdbf532ceb276bb99a9697293ed911f4873afc3f0ec5b4e197dec6b","observation_id":"f374187d-769d-4084-8ca9-cceac74b5a30","resolution":{"observed_at":"2026-08-06T20:45:08.961173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-19T05:48:02.828938Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2507.06261"},"observation_digest":"sha256:4daca7846770b2ff38190cb5d100f5c0c91b833ccad60c28eeca5012cadbed1f","observation_id":"1e5d77b1-ae26-4692-935b-c591748238e0","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T13:24:39.784349Z","title":"Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.784349Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:48ad3c4668ae2ab10b46de9fab7832d3983581e293743e0a45013b0d3cfe7d97","observation_id":"9bc0b383-70dc-41d8-b6f7-78728df2e511","resolution":{"observed_at":"2026-08-05T13:24:39.784349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T12:28:30.182788Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-17T20:52:53.724072Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.182788Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:f2dba4daedba85d717ec7e5718fb1bdea656bb76a903428515fa7fdeb1490b27","observation_id":"13a4d9b5-34ab-4d86-b96c-42772aa0706f","resolution":{"observed_at":"2026-08-05T12:28:30.182788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T11:56:10.885010Z","title":"Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-20T07:39:31.972350Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:10.885010Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:01a99040de617c7915e4273e2b1c41dbc890b545bb06e3edbd77e63d76c81fd7","observation_id":"f2747362-ce7e-4f6a-8c54-10ba720e97b6","resolution":{"observed_at":"2026-08-05T11:56:10.885010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:204629bb573f7bb1d796faffe165cb94d3e20c001320f47b1b42127f217e1b8d","observation_id":"f6b1e8b0-932f-4649-a42a-c00b089b2f09","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T07:44:02.827006Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2603.20633"},"observation_digest":"sha256:01863a466cf3a03751a8001cc2b3c872369e5b93eb364c927a0c0f2c256b78c4","observation_id":"fbd72c36-3362-4fad-a307-7bb6779e68a9","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:46.623267Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2604.03128"},"observation_digest":"sha256:232bc5f9a2bb3f98b2cf72cbf280592d8bc89f66e25d376d46ed9e1a6859461d","observation_id":"7eed3b2b-8d9c-4ee8-9ac6-a42438f9b796","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-15T14:36:44.426681Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:e063317cc65766b2924614af2497203ad52ee9d3fb6f7d95e246fec6bf32a51a","observation_id":"e2b0a151-a2cf-4c5c-9912-ebf4ada0572b","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-15T14:36:44.426681Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:5cdfcbd5d5085fc6e238c841e0f6ca8b9a3dd648d40f32960f27626ccd3be7d9","observation_id":"550446f8-6f7c-4807-91e4-2dbc659f2889","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T08:11:22.402552Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2604.15804"},"observation_digest":"sha256:036f8c1b65d2422deb6ab04aa04da20b4df50a407ca62b88558b6400b49347d3","observation_id":"fb8cab9e-44fe-49df-b047-586e83a01698","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2604.20733","last_updated":"2026-04-22T16:20:41Z","snapshot_observed_at":"2026-08-14T18:37:53.224749Z","submitted_at":"2026-04-22T16:20:41Z","title":"Near-Future Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:36.580600Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2604.20733"},"observation_digest":"sha256:11bf80411a3ea8aaadd5e5c939ac0313a9116bac7e6a53c7c09d32c67d91ae95","observation_id":"3d0e8800-e10b-491f-b257-ef0e97432a72","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-08-16T10:05:17.123494Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T08:23:41.819485Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2604.27083"},"observation_digest":"sha256:e233d55f63f8616079d4fe56c94ed4d4a288ca48a75208e7c1211f980a17e632","observation_id":"59bade78-b347-4887-87ec-819ddbbc3e3d","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2605.30265","last_updated":"2026-05-28T17:27:55Z","snapshot_observed_at":"2026-08-16T01:55:49.088456Z","submitted_at":"2026-05-28T17:27:55Z","title":"LoMo: Local Modality Substitution for Deeper Vision-Language Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T08:20:05.081980Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2605.30265"},"observation_digest":"sha256:2c7e4a2ba3aec6c1542877e39e30233d349616430dfd2819262477a4d71a2746","observation_id":"4bbfcb8f-eadb-4b75-a59b-a251d94b360b","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2606.03087","last_updated":"2026-06-02T03:17:34Z","snapshot_observed_at":"2026-08-13T22:16:38.264751Z","submitted_at":"2026-06-02T03:17:34Z","title":"Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-28T11:50:00.954670Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2606.03087"},"observation_digest":"sha256:29cfd0161422df405b6976e557f71fca265ab5fba33f2eb1bcdb2fe11604ed69","observation_id":"263ef561-e9fc-44e6-819e-76f2f5c527ef","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2606.06538","last_updated":"2026-06-04T01:11:21Z","snapshot_observed_at":"2026-08-16T05:49:13.707703Z","submitted_at":"2026-06-04T01:11:21Z","title":"WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-06-28T03:04:31.607329Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2606.06538"},"observation_digest":"sha256:8b14ea3f3e3633d10f9a43a802271fe2bd52d1aeda294bdb052d0a22683189fe","observation_id":"07df2b79-d2d4-4633-b939-2629537ab74e","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-08-17T19:24:43.936240Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:4c049c9abf49032dadab7eda9f2f140965584612a320bd10fd5d53111fa123e9","observation_id":"a0a912cf-793d-4413-8cd4-8a37758a026f","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:c750c546173e116f0a50c98e14ed5c646a60c22fb8ad249f522eb16dc696e83d","observation_id":"a48ec12d-9f72-41da-94b8-f208e36eb6d8","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2606.22437","last_updated":"2026-06-25T12:10:03Z","snapshot_observed_at":"2026-08-14T07:50:04.090458Z","submitted_at":"2026-06-21T10:57:43Z","title":"MMGist: A Comprehensive Multimodal Benchmark for 2027","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T11:05:14.573386Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2606.22437"},"observation_digest":"sha256:b07af207b8520165b1e05dfd943f1725fae2004bbfaa610206d3cfcd65266b25","observation_id":"2540585a-dd82-44aa-9c22-21aa383415c9","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:743ec01d5654e85b3114c1b304af291e07d51a97ee6d33ac3ef5658d691b95e1","observation_id":"0f0806fb-8a45-4f6e-80d4-a406a98866c3","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-31T05:01:29.035002Z","title":"arXiv preprint arXiv:2502.09696 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-19T20:54:23.370541Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.035002Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:bd637e7b4a11022f52a0e88edeefd8963caeea2d3104d93bb681118c26fe4350","observation_id":"4f6d477b-d9a0-4c0e-9363-d00355a128cb","resolution":{"observed_at":"2026-07-31T05:01:29.035002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-01T02:55:23.411003Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25294","last_updated":"2026-07-28T05:06:43Z","snapshot_observed_at":"2026-08-16T23:58:32.487101Z","submitted_at":"2026-07-28T05:06:43Z","title":"CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:23.411003Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2607.25294"},"observation_digest":"sha256:b673a404bc696858b3c8f423f5229121937869cf1e15f97e768b376f3b6558bd","observation_id":"4af62350-4877-4c2b-b949-36e3c2447264","resolution":{"observed_at":"2026-08-01T02:55:23.411003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09696/citation-record","integrity":"/paper/2502.09696/integrity","json":"/paper/2502.09696/citation-record.json","paper":"/paper/2502.09696"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T20:55:05.814584Z","title":"B., Bout, B., Chap- lot, D., Chudnovsky, J., Costa, D., De Monicault, B., Garg, S., Gervet, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.814584Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:af748db36d2369fb54c68a07bec2d6a82f40342a0a57b8a8dcad299fadf311a9","observation_id":"98444cc0-8a68-4581-9a43-5f5448bd715e","resolution":{"observed_at":"2026-08-07T20:55:05.814584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19474","last_updated":"2024-11-25T12:53:44Z","snapshot_observed_at":"2026-08-16T13:30:28.425420Z","submitted_at":"2024-07-28T11:56:03Z","title":"Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19474","snapshot_observed_at":"2026-08-07T20:55:05.825741Z","title":"Visual riddles: a commonsense and world knowledge challenge for large vision and language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.825741Z"},"links":{"cited_paper":"/paper/2407.19474","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:5c93af0a082dc55148727fbf873fc3ebc9d6f4b88fad673a08de99f01a6da1a7","observation_id":"c8d1fe0e-2467-4eee-b831-d50c64ba0559","resolution":{"observed_at":"2026-08-07T20:55:05.825741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03361","last_updated":"2024-10-21T04:26:41Z","snapshot_observed_at":"2026-08-16T13:28:08.884972Z","submitted_at":"2024-08-06T17:59:21Z","title":"GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03361","snapshot_observed_at":"2026-08-07T20:55:05.830828Z","title":"Gmai- mmbench: A comprehensive multimodal evaluation benchmark towards general medical ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.830828Z"},"links":{"cited_paper":"/paper/2408.03361","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:545cad84f41b6ded48aa802f2f1610ff8dcdfb668b694e0b69a8f783c5022867","observation_id":"1536fbc9-d5a1-4d3d-bd9a-969cd4e1f9d7","resolution":{"observed_at":"2026-08-07T20:55:05.830828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-08-17T05:38:14.090895Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-07T20:55:05.836265Z","title":"On the measure of intelligence","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.836265Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:612e822dab3edf8a1b4bdc17313e29fec0d4c6ea4fa599c8cdd17fa17fa7567f","observation_id":"b6a508fc-13af-4426-b05b-96e52b647042","resolution":{"observed_at":"2026-08-07T20:55:05.836265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04604","last_updated":"2025-01-08T05:24:50Z","snapshot_observed_at":"2026-08-16T13:00:34.704005Z","submitted_at":"2024-12-05T20:40:28Z","title":"ARC Prize 2024: Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04604","snapshot_observed_at":"2026-08-07T20:55:05.841893Z","title":"Arc prize 2024: Technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.841893Z"},"links":{"cited_paper":"/paper/2412.04604","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:a7c2ca7d5cfbf2ee2b588943cce6c3a232d0985fab241f87bdef3be1a9f38fe0","observation_id":"8f40461b-8772-4bd8-bff0-5f1e3331a42c","resolution":{"observed_at":"2026-08-07T20:55:05.841893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-19T13:25:25.058603Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-07T20:55:05.847019Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.847019Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:804c531048fbcdf056215230146ec519e6afbca8e1793835f01273c14bdf0a3b","observation_id":"767a398d-e1af-4f8b-a53c-584161bc72c7","resolution":{"observed_at":"2026-08-07T20:55:05.847019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T20:55:05.852088Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.852088Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:e90ac4777c51e3f4cb3fe88ef23634b9cec2e8ae04281ffe6d76e558781fc96b","observation_id":"99fdb64f-d6ee-4be9-a54d-e96b954eae30","resolution":{"observed_at":"2026-08-07T20:55:05.852088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T20:55:05.857068Z","title":"google/technologies/gemini/","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.857068Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:0b73b408eceb69967a636411df4f21e584d48deb050ae9f2f2fb9640e6151fc6","observation_id":"82ae0c76-dba4-46b9-8e4a-787f01ddfc51","resolution":{"observed_at":"2026-08-07T20:55:05.857068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T20:55:05.871183Z","title":"Seed-bench: Benchmarking multimodal llms with gener- ative comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.871183Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:ef6272a2c5ba7da7a7f36d5d6e0b65f1be7c7ed0855dbba2cb8dc31368b87acb","observation_id":"87ae7121-fab0-4754-8a54-8f688185c808","resolution":{"observed_at":"2026-08-07T20:55:05.871183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-16T13:26:03.746783Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-07T20:55:05.875661Z","title":"A survey on benchmarks of multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.875661Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:a4e601d136ee2856da66b503d408b4a5cc55ce15f7e2747ac304ea84bcec6b4b","observation_id":"98842e2d-20fb-41ae-86cc-e0076730f568","resolution":{"observed_at":"2026-08-07T20:55:05.875661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-17T04:34:26.881993Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-07T20:55:05.885072Z","title":"Adding error bars to evals: A statistical ap- proach to language model evaluations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.885072Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:d691f08a6c59ec62f7af7b91d7a7df61881c151a9a4cd8f9ed4a43e7f7945725","observation_id":"2700c133-03ac-4b66-9c79-01c30d5e6daf","resolution":{"observed_at":"2026-08-07T20:55:05.885072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02544","last_updated":"2024-07-16T01:40:34Z","snapshot_observed_at":"2026-08-16T14:21:41.017997Z","submitted_at":"2024-02-04T15:46:43Z","title":"LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02544","snapshot_observed_at":"2026-08-07T20:55:05.890289Z","title":"Lhrs- bot: Empowering remote sensing with vgi-enhanced large multimodal language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.890289Z"},"links":{"cited_paper":"/paper/2402.02544","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:6f238f3081e0c8829b0229be076d5c5745d174d3ad219227dfe788225baf04a1","observation_id":"3d61ac6b-2eba-4b79-ac24-e0bce58fc303","resolution":{"observed_at":"2026-08-07T20:55:05.890289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14749","last_updated":"2021-11-07T13:04:04Z","snapshot_observed_at":"2026-08-16T18:35:58.593110Z","submitted_at":"2021-03-26T21:54:36Z","title":"Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14749","snapshot_observed_at":"2026-08-07T20:55:05.895061Z","title":"G., Athalye, A., and Mueller, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.895061Z"},"links":{"cited_paper":"/paper/2103.14749","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:0c48b797c3e385c9e05a4b76f0b480880d2f5bc6e256a6d6c9516759f8f5860f","observation_id":"62238fca-fcb3-4dbc-b782-a8949f7f8a78","resolution":{"observed_at":"2026-08-07T20:55:05.895061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02287","last_updated":"2024-05-03T17:59:55Z","snapshot_observed_at":"2026-08-16T13:55:32.612021Z","submitted_at":"2024-05-03T17:59:55Z","title":"Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02287","snapshot_observed_at":"2026-08-07T20:55:05.905698Z","title":"Vibe-eval: A hard evaluation suite for measuring progress of multimodal language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.905698Z"},"links":{"cited_paper":"/paper/2405.02287","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:8d96ea6523987af4ec7dbc390c86e922336d0e8b3649808d4017338d1b58b747","observation_id":"d3f7a737-f74a-40f8-9644-b349ecab8e7f","resolution":{"observed_at":"2026-08-07T20:55:05.905698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T20:55:05.910610Z","title":"Qwen-Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.910610Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:90ce21ca691ad1789ca268d9d994d6e8eed5c32b9e49c9dc23b51e914e660cc6","observation_id":"9210a240-a627-4828-81f3-7bdd2adda71f","resolution":{"observed_at":"2026-08-07T20:55:05.910610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06468","last_updated":"2025-04-18T03:53:04Z","snapshot_observed_at":"2026-08-16T13:11:18.563373Z","submitted_at":"2024-10-09T01:41:49Z","title":"Does Spatial Cognition Emerge in Frontier Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06468","snapshot_observed_at":"2026-08-07T20:55:05.915677Z","title":"K., Wijmans, E., Kraehenbuehl, P ., and Koltun, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.915677Z"},"links":{"cited_paper":"/paper/2410.06468","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:f23637b6555ed44b5dbe22c2b4204f841c116856b5645e367412a9996f6ddfc5","observation_id":"c9d65d81-e54e-430e-9d2d-426f45546a9b","resolution":{"observed_at":"2026-08-07T20:55:05.915677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T20:55:05.920807Z","title":"Gemini 1.5: Unlocking multi- modal understanding across millions of tokens of context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.920807Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:5853a29e7c00a9d862911d55a43d589532d4c021a2608fa99903f01adac2d3ab","observation_id":"101bd3a9-40fa-4a20-b044-78c85ba72525","resolution":{"observed_at":"2026-08-07T20:55:05.920807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T20:55:05.926142Z","title":"L., Stickland, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.926142Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:4a5750dc60c4224555a070bad5f451008416f479694bb0334c176393a223b8c0","observation_id":"e9e3135e-90b7-4461-ad0c-40efa29d97a5","resolution":{"observed_at":"2026-08-07T20:55:05.926142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12387","last_updated":"2024-04-18T17:59:48Z","snapshot_observed_at":"2026-08-16T13:59:40.303924Z","submitted_at":"2024-04-18T17:59:48Z","title":"Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12387","snapshot_observed_at":"2026-08-07T20:55:05.932609Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.932609Z"},"links":{"cited_paper":"/paper/2404.12387","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:ad084da867aa97459734493df4debd14653bc5a0a4e6e75e869faad96a023697","observation_id":"72595cfc-cc34-4337-9f94-be24665ba15d","resolution":{"observed_at":"2026-08-07T20:55:05.932609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:55:05.938073Z","title":"GRAB: A Challeng- ing GRaph Analysis Benchmark for Large Multimodal Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.938073Z"},"links":{"citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:65a5289d7e3465dae9fd38367480b9dd0b8bcf2c9d9e4db577a4c0521fa9ca71","observation_id":"4f8f6fce-5fe8-4b96-b52e-dc6f83720153","resolution":{"observed_at":"2026-08-07T20:55:05.938073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T20:55:05.942731Z","title":"Scaling llm test- time compute optimally can be more effective than scal- ing model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.942731Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:0f2bc13a306d959ef1469efebb804dd6896af8dbdc0dd2de7f3f6589faa4ee4f","observation_id":"516db7e5-ea15-4bea-b862-da5dfe2b613d","resolution":{"observed_at":"2026-08-07T20:55:05.942731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T20:55:05.948087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.948087Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:fe77fdfcf6139987dbc999029f8dde0a4ab8353768a1930a33fa8bf3cd14c9c9","observation_id":"0effa166-3eca-4f2c-b395-f6d51264615f","resolution":{"observed_at":"2026-08-07T20:55:05.948087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T20:55:05.953189Z","title":"M., Hauth, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.953189Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:344be57bdc24e126c71255d2acf8e50c7145bfdbb5d751fefbc4c5cec770f44b","observation_id":"7e23e631-42cf-44a5-9e20-f6532ec450be","resolution":{"observed_at":"2026-08-07T20:55:05.953189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T20:55:05.958169Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.958169Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:9c15d6d058c60fe2fc39ec0566c5b455e9f72f8e92a2c00013d8dc57802c6e04","observation_id":"07b145c7-c349-4126-9bcd-10a7ae592afe","resolution":{"observed_at":"2026-08-07T20:55:05.958169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14161","last_updated":"2025-09-10T08:35:19Z","snapshot_observed_at":"2026-08-16T19:31:08.289292Z","submitted_at":"2024-12-18T18:55:40Z","title":"TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14161","snapshot_observed_at":"2026-08-07T20:55:05.971251Z","title":"Y ang, Z., Li, L., Lin, K., Wang, J., Lin, C.-C., Liu, Z., and Wang, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.971251Z"},"links":{"cited_paper":"/paper/2412.14161","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:c29093bcdeae31bb7c4e8b83750dac2aade6fbec34c2c9236a40dc0d9475175c","observation_id":"3b19d9eb-6c8a-4aa5-88c9-bd1656193ae2","resolution":{"observed_at":"2026-08-07T20:55:05.971251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T20:55:05.975587Z","title":"Mm-vet: Evaluating large multi- modal models for integrated capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.975587Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:25150b9532dc65fc1a12e56b625de8f8daefba0d37667db202e778c895f24e12","observation_id":"2d9b4615-be23-4171-8b8a-227386e1cbac","resolution":{"observed_at":"2026-08-07T20:55:05.975587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05379","last_updated":"2022-06-11T00:04:49Z","snapshot_observed_at":"2026-08-18T23:16:47.496929Z","submitted_at":"2022-06-11T00:04:49Z","title":"A Benchmark for Compositional Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05379","snapshot_observed_at":"2026-08-07T20:55:05.979890Z","title":"A benchmark for compositional visual reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.979890Z"},"links":{"cited_paper":"/paper/2206.05379","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:0c161cb7efb18cd66260db211190fbcd9ea8030834153d68dde03c9f79a9d202","observation_id":"b4757463-6499-4e27-a1ea-883ca2a50071","resolution":{"observed_at":"2026-08-07T20:55:05.979890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12381","last_updated":"2025-02-18T06:00:26Z","snapshot_observed_at":"2026-08-18T20:29:05.296595Z","submitted_at":"2024-10-16T09:04:57Z","title":"HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12381","snapshot_observed_at":"2026-08-07T20:55:05.985112Z","title":"Humaneval-v: Evaluating visual understanding and reasoning abilities of large mul- timodal models through coding tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.985112Z"},"links":{"cited_paper":"/paper/2410.12381","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:972ca640fb7ec426ac9f116d2c7f26669d758a95426c12a4005305db0e89be16","observation_id":"781a1daf-41e5-4c0d-a0d0-9b7e712c6709","resolution":{"observed_at":"2026-08-07T20:55:05.985112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:55:06.665745Z","title":"Note, o1 pro was accessed through the ChatGPT interface preventing hyperparameter configuration","venue":null,"work_id":"e2f6f2e1-7a86-4acf-9d4f-1034f9d79e34","year":2024},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.990141Z"},"links":{"citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:cb6c737aecc267e9da80a3a3b40ede9b4d86eee7ed9490386525362e15377f37","observation_id":"27902e1d-21ee-4f6e-ab39-e9afcad13154","resolution":{"observed_at":"2026-08-07T20:55:06.672110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03113","last_updated":"2021-04-15T10:03:37Z","snapshot_observed_at":"2026-08-16T18:33:18.216422Z","submitted_at":"2021-04-07T13:34:25Z","title":"Scaling Scaling Laws with Board Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03113","snapshot_observed_at":"2026-08-07T20:55:05.861532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.861532Z"},"links":{"cited_paper":"/paper/2104.03113","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:f3726958076083ade3c3254ac9daa4e562d3b7feae2414703f74e92b197dc42f","observation_id":"f9ad8685-9bee-4776-b457-bda53e46d68d","resolution":{"observed_at":"2026-08-07T20:55:05.861532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-07T20:55:05.967050Z","title":"URL https://www .aclweb","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.967050Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:7aec4c5659f0f63049727a9b12647ca48486d6b31899ce47b271b7d6561a11f0","observation_id":"fd7ad324-428f-48a6-baaf-1f530e6f3ee4","resolution":{"observed_at":"2026-08-07T20:55:05.967050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:55:06.703230Z","title":"Hello gpt-4o | openai","venue":null,"work_id":"09762a15-9a3d-499f-b11b-c0d849d23c5e","year":2024},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.899812Z"},"links":{"citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:cfab68aa4e603a7ff578b8da6353a5dc414e3584e8370f236fbb87bcfd152ea3","observation_id":"b43499bb-492b-4552-8110-d242ea5d55db","resolution":{"observed_at":"2026-08-07T20:55:06.712697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:55:06.683572Z","title":"Transformers: State-of- the-Art Natural Language Processing","venue":null,"work_id":"90b5db9a-0f17-4287-ab5e-d8e59108cb7a","year":2020},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.962681Z"},"links":{"citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:9adb78267245eaecd6f60e2692e9799da3a8484033fec07181eb05718bbf9493","observation_id":"b1173d92-1231-48ed-a417-87fc67c79050","resolution":{"observed_at":"2026-08-07T20:55:06.688633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09175","last_updated":"2024-06-13T14:37:04Z","snapshot_observed_at":"2026-08-16T13:43:19.152700Z","submitted_at":"2024-06-13T14:37:04Z","title":"ReMI: A Dataset for Reasoning with Multiple Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09175","snapshot_observed_at":"2026-08-07T20:55:05.866702Z","title":"Kazemi, M., Dikkala, N., Anand, A., Devic, P ., Dasgupta, I., Liu, F., Fatemi, B., Awasthi, P ., Guo, D., Gollapudi, S., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.866702Z"},"links":{"cited_paper":"/paper/2406.09175","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:69c0cfc6eba29ce3d1b23b4b10b54da90638b83cf9d10e58563915219cd96f1d","observation_id":"a2877bd8-df52-4cf0-ad51-32bb199e8e0e","resolution":{"observed_at":"2026-08-07T20:55:05.866702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:55:06.727873Z","title":"Mistral AI API (0.0.2)","venue":null,"work_id":"b7e2262d-7b13-4790-8b5f-376e5a4bfc63","year":2024},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.820471Z"},"links":{"citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:6da3624ddffffdba70fea57c6ae257183f66897928a559a65a7b5417e0973733","observation_id":"2cc69712-5543-4614-923e-709f5745dddf","resolution":{"observed_at":"2026-08-07T20:55:06.732765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T20:55:05.879967Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T20:55:05.879967Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2502.09696"},"observation_digest":"sha256:60ca1de7bb1b6aad97f6d278ef3d61e2b61ac545c9ee578132b39fa60ca0f256","observation_id":"344fff01-4e55-47a8-a7fc-0618645bdd97","resolution":{"observed_at":"2026-08-07T20:55:05.879967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 28 inbound Pith citation observations for arXiv:2502.09696."}