{"as_of":"2026-08-23T00:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a23a5185e4c2d80b63433f234e345e6a13e515fd1b02539530b43021b08527f7","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T09:30:46.564013Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08317/citation-record","integrity":"/paper/2607.08317/integrity","json":"/paper/2607.08317/citation-record.json","paper":"/paper/2607.08317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.210918Z","title":"DeepSeek-V4: Technical report.https://huggingface.co/deepseek-ai/ DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf, 2026","venue":null,"work_id":"e115960a-0449-4dbb-a3bc-b096b47e63b6","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:30efe8980603e1933b72c75f92610043af05234af3081cfbe997607c1355a606","observation_id":"fb89b955-a765-46e9-9c14-7facc794262c","resolution":{"observed_at":"2026-07-10T09:37:01.212164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.244387Z","title":"Introducing GPT-5.5.https://openai.com/index/introducing-gpt-5-5/, 2026","venue":null,"work_id":"60003549-dd80-431a-ae76-b0561d481093","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:14dfacc2267940bc571336c88a9e0f582ff87522e9ee81bda7d76bfd694477bb","observation_id":"6b6745db-9992-493e-999b-c363b4109f8c","resolution":{"observed_at":"2026-07-10T09:37:01.246226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.221351Z","title":"Gemini 3.1 Pro Model Card.https://deepmind.google/models/ model-cards/gemini-3-1-pro/, 2026","venue":null,"work_id":"17a00d65-6eea-4609-baff-a3b37389a426","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:e537f98ed8516358963d127b7dceb1fd1b2f9bb7d20cdb3650ed8892f0ac7f95","observation_id":"e920904f-6d1f-4d4e-a829-a553f9dffdcc","resolution":{"observed_at":"2026-07-10T09:37:01.222527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ba484425e2e84b65081dfe4285fea7368b0408388c114702996d34276b781074","observation_id":"3fbcf0e2-3961-436e-b4c3-969ce403f57c","resolution":{"observed_at":"2026-07-10T09:37:00.870806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:af8d098b946ba18ee148db6a5dceb3c44ad5b957ae1560e43a62c36416077f04","observation_id":"abf63560-7b78-4d65-a202-cd66e875d6fc","resolution":{"observed_at":"2026-07-10T09:37:00.767104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.239419Z","title":"Swe-bench: Can language models resolve real-world github issues? InThe twelfth international conference on learning representations, 2023","venue":null,"work_id":"2d55d3e9-74e7-45eb-847c-77ecbc1dfa86","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:f6ba39e68e516e484d467b8c85c57e8a68aee9474583303e21cf6d105ef97aef","observation_id":"369e8e9f-774a-4347-b6df-b25c1b3ac7d5","resolution":{"observed_at":"2026-07-10T09:37:01.240601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-17T12:39:54.496393Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":"2605.00674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-07-10T09:37:00.861422Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","venue":"cs.CL","work_id":"a302077a-ac03-4988-adce-c84a57db5425","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:beb2e79f51b6a2982eb35d019f69de9815a76ae62c3375df6a8ec2d36d00b75e","observation_id":"6d8cfb2e-dda7-437e-a630-cb38a66147e2","resolution":{"observed_at":"2026-07-10T09:37:00.862871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:a20b26ea15ff751400f99d49dd28becd541ab657c1dd85d05a84316643f8314a","observation_id":"1424dec4-ba42-4d34-a962-9c4813c9ba32","resolution":{"observed_at":"2026-07-10T09:37:00.857750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.741999Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":"08908afa-03c9-4035-9817-6ed61dde66a1","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:82aed5c2e9764d4fec0ddcc87682ef010ec618541a17b8538262ae08787bb5f9","observation_id":"19d5dd26-2ad7-478d-8f4a-0cfc988732c5","resolution":{"observed_at":"2026-07-10T09:37:01.242321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.242819Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"876c9b86-6597-4244-9256-1be52ac73bfe","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8ea6188e5626e3c4f526ad4d4efcc55bcab027fe1d50b6a9754c6e90d2e95ebc","observation_id":"fb61c22b-424b-4e4b-a228-61f8ad37fca0","resolution":{"observed_at":"2026-07-10T09:37:01.243904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:27b2b7d7574280235a14632779af375f91367f4e4cc43b19c446ab74127dcbd1","observation_id":"444e852c-2a98-42ef-b0f3-e00de145fcdb","resolution":{"observed_at":"2026-07-10T09:37:00.783817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16135","last_updated":"2025-05-22T02:24:35Z","snapshot_observed_at":"2026-08-13T13:49:12.284764Z","submitted_at":"2025-05-22T02:24:35Z","title":"Sudoku-Bench: Evaluating creative reasoning with Sudoku variants","version":1},"cited_work":{"arxiv_id":"2505.16135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16135","snapshot_observed_at":"2026-07-10T09:37:00.822035Z","title":"Sudoku-bench: Evaluating creative reasoning with sudoku variants","venue":"cs.AI","work_id":"74aa17a5-6a31-423f-855c-216d5f929f64","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.16135","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:00ec62c7460a6069c8a1ff79a4a5294362828254e7ad3fb65be38ce3d280cfb6","observation_id":"e916a76a-2e68-4263-9b27-c63a14cdd725","resolution":{"observed_at":"2026-07-10T09:37:00.823453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.217816Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"a169b3e6-e66f-4128-afc4-96a23085ae1f","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:be5b00951c51f63964b5daaca3b17740c3f374c6054b5fc263a981416cdadeaf","observation_id":"cc5e9b3f-bb41-46b2-a272-d7e58a8ff10c","resolution":{"observed_at":"2026-07-10T09:37:01.218985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18626","last_updated":"2024-12-19T22:47:08Z","snapshot_observed_at":"2026-08-19T23:30:08.010312Z","submitted_at":"2024-12-19T22:47:08Z","title":"Why Do Large Language Models (LLMs) Struggle to Count Letters?","version":1},"cited_work":{"arxiv_id":"2412.18626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18626","snapshot_observed_at":"2026-07-10T09:37:00.787799Z","title":"Why Do Large Language Models (","venue":"cs.CL","work_id":"b8f957e9-4c71-4c2a-bcbd-0a897eb5423d","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2412.18626","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ead727bbf5b9b9067d31fe03ce46ca48382aea4b49fc6acb8f802d1002bc9414","observation_id":"04096664-3215-41c4-be42-7a4028081a90","resolution":{"observed_at":"2026-07-10T09:37:00.788988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:47fc274690e05ba508ff3e4ecc384a5e018bac21c60e53cd5c31e8bd4eac9542","observation_id":"71f17e32-ee9b-4509-b9e9-2e4ec44e263e","resolution":{"observed_at":"2026-07-10T09:37:00.825956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08180","last_updated":"2025-03-27T16:07:18Z","snapshot_observed_at":"2026-08-12T04:16:25.054962Z","submitted_at":"2025-02-12T07:37:39Z","title":"Enhancing LLM Character-Level Manipulation via Divide and Conquer","version":2},"cited_work":{"arxiv_id":"2502.08180","doi":"10.48550/arxiv.2502.08180","metadata_source":"pith","pith_arxiv_id":"2502.08180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing LLM Character-Level Manipulation via Divide and Conquer","venue":"cs.CL","work_id":"83bd1187-b779-4778-9b6f-58ac139dfb3c","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2502.08180","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5124d1289ef713b29ad745721ee1f64fc902c2179b0861b490602b20ac2175d8","observation_id":"2c8f1418-6c6d-47e8-820a-f65a8c25c593","resolution":{"observed_at":"2026-07-10T09:37:00.852125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.234721Z","title":"Com- positional generalization from first principles.Advances in Neural Information Processing Systems, 36:6941–6960, 2023","venue":null,"work_id":"c5acda82-3e88-4727-b3ad-e381223d4cb2","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:63069312987cc911b6a509f326a39380c34fb2b870f53c43bbb7cf2abc344767","observation_id":"80994607-8144-48c9-ae13-4de84877d84f","resolution":{"observed_at":"2026-07-10T09:37:01.236873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.237553Z","title":"Make it count: Text-to-image generation with an accurate number of objects","venue":null,"work_id":"eec4ba75-5766-4efe-9a2e-b32f40181baf","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:afa1a77eca81e4a02489e946a5c29107a944dfc258ca11517b29f9e70dda7da5","observation_id":"aee98673-0ab1-47a6-b4f8-44d5a8404c97","resolution":{"observed_at":"2026-07-10T09:37:01.238893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05092","last_updated":"2025-03-18T11:43:52Z","snapshot_observed_at":"2026-08-15T10:17:34.826000Z","submitted_at":"2025-02-07T17:11:23Z","title":"Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2502.05092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05092","snapshot_observed_at":"2026-07-10T09:37:00.846980Z","title":"Saxena, A","venue":"cs.CV","work_id":"2af6578a-e9da-47d4-b1a4-f80895392fa6","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2502.05092","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:766ea650dd11808bcf030a98cf4e8d44dad7db81691770ca72c2b9cc5fb765dd","observation_id":"f324f054-04dd-4641-ac92-5e0bcd1808e0","resolution":{"observed_at":"2026-07-10T09:37:00.849556Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:00.837582Z","title":"Constraintbench: Bench- marking llm constraint reasoning on direct optimization.arXiv preprint arXiv:2602.22465, 2026","venue":null,"work_id":"39a0d46f-e336-4014-9238-6f5ac0c9a7c3","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:b53ee1281ad24abc60f479519f85baf2398960e5bb0a6344655c17be95d17537","observation_id":"4695c38f-5842-4c09-9368-5e0954083603","resolution":{"observed_at":"2026-07-10T09:37:00.839546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03916","last_updated":"2026-05-10T15:38:24Z","snapshot_observed_at":"2026-08-02T06:58:52.885755Z","submitted_at":"2026-02-03T17:52:02Z","title":"SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?","version":3},"cited_work":{"arxiv_id":"2602.03916","doi":"10.48550/arxiv.2602.03916","metadata_source":"pith","pith_arxiv_id":"2602.03916","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?","venue":"cs.CV","work_id":"1bc94b20-7b00-41ef-b993-991206d25ec9","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2602.03916","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:de9a2347fe07f66fed3193145324a45a2505d2d86b5e4c019a3415da779013a5","observation_id":"c8437ce7-c7ed-4f52-97ab-0d8769438b31","resolution":{"observed_at":"2026-07-10T09:37:00.835854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11854","last_updated":"2025-05-17T05:36:14Z","snapshot_observed_at":"2026-08-16T17:40:54.467150Z","submitted_at":"2025-05-17T05:36:14Z","title":"Evaluating the Logical Reasoning Abilities of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.11854","doi":"10.48550/arxiv.2505.11854","metadata_source":"pith","pith_arxiv_id":"2505.11854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating the logical reasoning abilities of large reasoning models, 2025 a","venue":"cs.AI","work_id":"6dbfd621-0f11-4c5c-b082-a1f07aaf0ddc","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.11854","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:220d7ff8e0cdb0aa96db1812e828047162a2380867b098bcc2ce676971d79edb","observation_id":"8b3fd663-13d1-4edf-b255-7444bc170294","resolution":{"observed_at":"2026-07-10T09:37:00.772539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-19T05:43:25.096121Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:acce5dfbda0f0fb594d043f6f81def28d1d18fd867882b1022741880dabf190c","observation_id":"1bac3f50-ff3e-4870-b37c-ed52de082641","resolution":{"observed_at":"2026-07-10T09:37:00.796446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.224821Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":"8f39aa4d-b93d-409e-8a38-2477cc7aa7de","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:80e0a4e967dda29de3373914379449d3156c91269945c1d354dd0c3d77e2a5c1","observation_id":"6dde6904-aad2-46a8-89ac-2f44a5537624","resolution":{"observed_at":"2026-07-10T09:37:01.225974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.226462Z","title":"Beyond accuracy: Behavioral testing of nlp models with checklist","venue":null,"work_id":"66dbd026-31b8-42cb-924f-e840a5e68a82","year":2020},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:fef55266680c9f77397d88112574e4ea949a5a3af43d9285d0a706fc49359253","observation_id":"d7e9917d-5c40-4f73-8cd6-a29dd819cb4c","resolution":{"observed_at":"2026-07-10T09:37:01.227610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.228115Z","title":"Right for the wrong reasons: Diagnosing syntactic heuristics in natural language inference","venue":null,"work_id":"0235e12f-20f4-4429-9206-3508f787b0fc","year":2019},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:b22a734ba8d91054ba2742c3dc2c66ef62cdcbe8783397e2676c87d9be9a14d1","observation_id":"81fe030f-7e55-495f-a7f2-730fa174e8e2","resolution":{"observed_at":"2026-07-10T09:37:01.229229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.231522Z","title":"Dynabench: Rethink- ing benchmarking in nlp","venue":null,"work_id":"6b37433b-49da-47f5-b034-9c9e520e209a","year":2021},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c0d45612bcad79e09656a3153ae2444360983fe9aa379c2d1a5dd0cfa7c5cd13","observation_id":"567220a3-61df-4673-b776-71b33ce6404f","resolution":{"observed_at":"2026-07-10T09:37:01.232558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.233065Z","title":"Evaluating models’ local deci- sion boundaries via contrast sets","venue":null,"work_id":"c13386a3-d628-4a36-92d5-3c4dcd63633d","year":2020},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ca5a16b054fc9d54f834d2d97ebd6e7287d3f12da481b7af45f1ada5d9094552","observation_id":"e98050e3-e60b-422c-9318-a6a5e7d6d264","resolution":{"observed_at":"2026-07-10T09:37:01.234199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:32ab440ae364b1b8ecce40b4a82a4babf472b1afd89e933a242bb7969af97a0a","observation_id":"373e7d6a-d96a-48b6-9856-e196cb494499","resolution":{"observed_at":"2026-07-10T09:37:00.775167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-20T06:11:48.391709Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":"2505.21327","doi":"10.48550/arxiv.2505.21327","metadata_source":"pith","pith_arxiv_id":"2505.21327","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-reasoning: A comprehensive benchmark for logical reasoning in mllms","venue":"cs.AI","work_id":"7f0cf532-adf5-4663-b708-1a3763ed47d0","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.21327","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:461c936395272ed0643bd363162803a0ef3f6da58b5dc028f0985be5338ad6d4","observation_id":"26086492-4058-4ff1-b214-0862364f95a6","resolution":{"observed_at":"2026-07-10T09:37:00.791323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:18.592087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:18.592087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:7cb680c4bcbfe5c29d603f03c501558d7b8f9ef8a4402a2b00ba2e018c2e4fc8","observation_id":"6e374258-76b2-41eb-b4c9-fc9e553ed08e","resolution":{"observed_at":"2026-07-10T09:37:00.828567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.212698Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":"189206c3-17de-4465-90b9-8d62ebd0e8df","year":2018},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8b160b15a91982985eef0e77e223d74207f55c39f438f85f93a2017ed78a8d03","observation_id":"e70337f8-d115-4ea9-8a37-4e19b0ba1fd7","resolution":{"observed_at":"2026-07-10T09:37:01.213885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05425","last_updated":"2026-04-28T02:01:09Z","snapshot_observed_at":"2026-08-20T00:15:58.158571Z","submitted_at":"2025-06-05T05:51:35Z","title":"SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":"2506.05425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05425","snapshot_observed_at":"2026-07-10T09:37:00.785220Z","title":"SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning","venue":"cs.CV","work_id":"d023fb0d-85c5-4139-b83f-c51613886c55","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2506.05425","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c0630122a2cc2e23c9cdb2b5abbf55d66c9384c6adcb28d08108c062199e2fcf","observation_id":"4fefd41b-2774-4ea0-88ea-7bd0b739f767","resolution":{"observed_at":"2026-07-10T09:37:00.786672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.229744Z","title":"A survey on large language model reasoning failures","venue":null,"work_id":"805af10a-432d-4b2e-9ee9-079f13e5bc57","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:b2908ccbd1f15e81de02818b302950a124c6e435db6c31201e3708c0b31336ec","observation_id":"ea6a7385-f114-4edb-8153-c20580e6ae86","resolution":{"observed_at":"2026-07-10T09:37:01.231040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.214431Z","title":"GSM-plus: A compre- hensive benchmark for evaluating the robustness of LLMs as mathematical problem solvers","venue":null,"work_id":"a2627f8e-62ac-4f2b-bfe0-402044c6d6a3","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:75a6caa2672fdae5e6de900d27d94bbfbd33d40468cdd2e1b32be1aa6994cb1c","observation_id":"b48fcf0d-20e5-4070-ad95-94715a309822","resolution":{"observed_at":"2026-07-10T09:37:01.215615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-20T16:37:00.586669Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"cited_work":{"arxiv_id":"2502.06453","doi":"10.48550/arxiv.2502.06453","metadata_source":"pith","pith_arxiv_id":"2502.06453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations","venue":"cs.LG","work_id":"621c78c6-7ff2-4364-8642-ceeac09ac208","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2502.06453","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:1e22ae7d2c15b201762f9ebfce08329ca88d7af2d251e1f06d59591b7700019f","observation_id":"48682d90-85c8-46ef-9c78-9d6c89d3733e","resolution":{"observed_at":"2026-07-10T09:37:00.719526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:19.366857+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:19.366857+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-21T14:11:30.905906Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.05229","doi":"10.48550/arxiv.2410.05229","metadata_source":"pith","pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","venue":"cs.LG","work_id":"7d26909d-cb69-48f7-b93e-7d6fcc281415","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:de587432afc527162492f2a7360ebbff7b0482525ef2fc85245020bac58788a6","observation_id":"d84acaac-6e52-4e22-84b8-ca0cabfc0818","resolution":{"observed_at":"2026-07-10T09:37:00.716546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:19.596854+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:19.596854+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.216168Z","title":"Varbench: Robust language model benchmarking through dynamic variable perturbation","venue":null,"work_id":"79dde9a4-c3f0-428d-b330-36fbe5b97042","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:6d96713ce5ca64c7d3492b9d2544577062a9f5b6e0db99fae59addd162e94cf4","observation_id":"2a722544-6024-4835-9733-368f87fefe00","resolution":{"observed_at":"2026-07-10T09:37:01.217320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.251886Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"217e4962-b6b3-4402-ab00-96bc6344fb75","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:d5fda83ceeaba7cf919aac2ebff7520981d81dd4f4ff721aca7e7dbab5ff5955","observation_id":"53a8bb3c-d28a-45ea-9f43-a427250d9880","resolution":{"observed_at":"2026-07-10T09:37:01.253065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.248336Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"4ab99dcb-7e3e-44fa-bcd5-165364d12e2d","year":2022},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8e04c5c8c4dade9e7934ef611f2aa6c43ac792a4f449780af627ecfb24785181","observation_id":"86cf627b-7d55-4a3f-8910-5f6e1833cda0","resolution":{"observed_at":"2026-07-10T09:37:01.249610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-16T12:46:58.006510Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2503.19707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-07-10T09:37:00.841150Z","title":"Mind the gap: Benchmarking spatial reasoning in vision-language models.arXiv preprint arXiv:2503.19707","venue":"cs.CV","work_id":"06006849-24f6-4955-9dd0-1cbe59b0fc66","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:fac3b4849b51b532daf3c06d90ac45297b11b1cbe7c0e177e8422884f6964bae","observation_id":"a6d702a7-d72f-4393-af86-8a1340ef24b8","resolution":{"observed_at":"2026-07-10T09:37:00.842655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.205957Z","title":"Do vision language models rotate in mind? evalu- ating spatial transformation reasoning, 2026","venue":null,"work_id":"e4f7aca3-09dc-44ce-8895-9c09ab48a9a2","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:483a6a914aafbcebed96077b11c143420208b9b46c6cd1d2657912a6517c6063","observation_id":"fd648ad6-4605-44c0-9ce8-e6505fedf286","resolution":{"observed_at":"2026-07-10T09:37:01.207110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.00686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:00.871884Z","title":"Lvlm-count: Enhancing the count- ing ability of large vision-language models","venue":null,"work_id":"eaa7ff33-ba15-43ec-b7d0-45e269d2cb8e","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:665e0950633ad46d06bc1a3bc5f9ef77b47e534d6bd8fc16b99adf6991f6ea4a","observation_id":"acda9658-6897-4f41-8808-e375db2829ff","resolution":{"observed_at":"2026-07-10T09:37:00.873469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-08-20T13:30:34.878342Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":"2210.01240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-07-10T09:37:00.809818Z","title":"arXiv preprint arXiv:2210.01240 , year=","venue":"cs.CL","work_id":"ec643dee-886e-4ede-bc9d-bc244c397d0a","year":2022},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:b579fcbe7dd82eda41fda0339d7a226594d34cd1f2073c59c1b84a56a873098d","observation_id":"2b03149e-7718-4fa4-bff7-dabc9643c160","resolution":{"observed_at":"2026-07-10T09:37:00.811042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19730","last_updated":"2024-10-29T03:48:33Z","snapshot_observed_at":"2026-08-20T04:14:46.833330Z","submitted_at":"2024-10-25T17:56:24Z","title":"Counting Ability of Large Language Models and Impact of Tokenization","version":2},"cited_work":{"arxiv_id":"2410.19730","doi":"10.48550/arxiv.2410.19730","metadata_source":"pith","pith_arxiv_id":"2410.19730","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2410.19730 , year =","venue":"cs.CL","work_id":"03adbc37-2463-4298-b12c-afa9344ad2de","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2410.19730","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:98a9cfae49088428b0fd81dd0ca9df1b78401760c303995b55b3303d070c562c","observation_id":"3cdbb8bb-b1f9-4ed2-854e-fce8ecb77e73","resolution":{"observed_at":"2026-07-10T09:37:00.803900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.209363Z","title":"Inspect AI: Framework for Large Language Model Evaluations, May","venue":null,"work_id":"a8b58292-344d-4f79-9a94-63947f8691b3","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:482ce788436f1ebb9d695a72d44aa9a46d9a63dacbfa5277e1c5b6a3a780c20e","observation_id":"debb9cac-ab1f-4d52-b5f5-93ee5966b07c","resolution":{"observed_at":"2026-07-10T09:37:01.210429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.246781Z","title":"MIT License","venue":null,"work_id":"0b529e5a-7cd1-4863-b6be-839ef07023bb","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:269bc13134f7c0d887b7b32d432a9b24c97db8390591cf1889003c3a9dad9857","observation_id":"c5fa324f-3a3c-41a0-99f6-c3bc31ae114c","resolution":{"observed_at":"2026-07-10T09:37:01.247831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:7c96c23478647d7a6ba5de118dce6d4ff6044a02a9bfcecb361bf64f074e01f4","observation_id":"bf73e651-ae8f-4b00-9d82-fbffd37af242","resolution":{"observed_at":"2026-07-10T09:37:00.860103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:6c6c1dae654656181ec458fc2e006906c0292137795b674790e582f6b0cf08f3","observation_id":"98b97f9b-5598-4661-a084-2f6dc2ed5391","resolution":{"observed_at":"2026-07-10T09:37:00.855021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9224cea1e35e6efc95df4d65dbcff575d7070dce7cc0673e517ec4a7bd158b14","observation_id":"8eb2c0a7-7ef4-4b32-a435-0b6f8dfdcce2","resolution":{"observed_at":"2026-07-10T09:37:00.781400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:cbadf5b3b8704615f1941eb24be6ae458dea2977e71805bf5c34244cb99dd979","observation_id":"d6deaa6f-d614-4e12-81cb-bd358c064cd5","resolution":{"observed_at":"2026-07-10T09:37:00.777604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.250180Z","title":"Gemma 4 model card.https://ai.google.dev/gemma/docs/core/model_ card_4, 2026","venue":null,"work_id":"b6154b39-ca51-40b1-a8aa-d329c6b20b58","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:0040348dd341b5f17419fd4a28ba7e2bf6377ab08d2bcb4d5b53c71b3db50ddb","observation_id":"87f7324f-5650-4da2-ab07-c4ea61ac4e52","resolution":{"observed_at":"2026-07-10T09:37:01.251362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:1863e1df2f18345ca337b472d0055cce61a99441ab7e8ecc782d12539581626f","observation_id":"fdc1c3a6-7ccb-4da7-8117-e0a08ed0edea","resolution":{"observed_at":"2026-07-10T09:37:00.801393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:631209125604fb52aeca6385c410cb650797ebc0fb61ec430d36881c77aed56e","observation_id":"50764985-aa5c-4325-8fb2-2d2839654f24","resolution":{"observed_at":"2026-07-10T09:37:00.868256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.202470Z","title":"Gemini 3 Pro Model Card.https://storage.googleapis.com/ deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf, 2025","venue":null,"work_id":"3ace207d-ba24-4eaf-8243-034764f3b4d9","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:7f78ccf807c89035a851a6a9f217065be7e637c58e97294dc20c40da0c1bb661","observation_id":"1cc6a025-70d0-4bff-b9bd-ef32b4b4c19b","resolution":{"observed_at":"2026-07-10T09:37:01.203644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:e0a3443f8d5260fb843cf143f9fa5ec8d2dde1be64f90e75bfeb316a74ae7d73","observation_id":"9139270f-04c9-4150-a734-0c2733d9b247","resolution":{"observed_at":"2026-07-10T09:37:00.808527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:14.623228+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:14.623228+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.204167Z","title":"Introducing GPT-5.4.https://openai.com/index/introducing-gpt-5-4/","venue":null,"work_id":"203634bc-bc17-4e6c-98ec-60e7612f1484","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:2bc9561cbf4a0334699f674e31b1a77567ec827771473d8e70d44b24910b2953","observation_id":"0155e527-5608-4846-a879-1ac1c49d9020","resolution":{"observed_at":"2026-07-10T09:37:01.205427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.207619Z","title":"Efficient memory management for large lan- guage model serving with pagedattention","venue":null,"work_id":"b5180891-e1cc-485a-b9ce-6155d586b83e","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:35c286f10b66f532c12103149ad7754de1a44aee14a479d42723b20e9c548f2e","observation_id":"cf198685-5152-4736-808d-bf269ca1b36d","resolution":{"observed_at":"2026-07-10T09:37:01.208853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.219494Z","title":"Artificial Analysis Intelligence Benchmarking Methodology: Artificial Analysis Intelligence Index v4.0.4.https://artificialanalysis.ai/methodology/ intelligence-benchmarking, 2026","venue":null,"work_id":"f24ee7f6-99ba-49d5-b55d-650623e95537","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:86e6f33e2027160ae9188589f6f8f6c2055a26a805380d8db52411beec10ee26","observation_id":"34d34ffa-f213-4783-a425-799bb10c60b7","resolution":{"observed_at":"2026-07-10T09:37:01.220841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:54d5135eb919e9677faa81947e5ee6c2919b112eaede113b0b20426b46fd9bf2","observation_id":"acf5a55d-de7a-433a-ae07-7dbffe84280d","resolution":{"observed_at":"2026-07-10T09:37:00.710564Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-08-14T11:40:59.457005Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:f59aebf8987fab1eddf368a1f04c7b3fad84128750deab13f9cc064b508a5261","observation_id":"70d3d12c-f759-43c3-9068-e0e2a8fea382","resolution":{"observed_at":"2026-07-10T09:37:00.830888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-08-20T02:32:10.164015Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:89d06f830fc7f273ab8b0614333ffa05c60d3eeadcdae86cd20ab3c6b543fe6b","observation_id":"b1db2c66-4082-4eb3-8e2a-a2830cc143a2","resolution":{"observed_at":"2026-07-10T09:37:00.702370Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23941","last_updated":"2026-04-19T17:09:48Z","snapshot_observed_at":"2026-08-20T05:51:01.664945Z","submitted_at":"2025-05-29T18:47:58Z","title":"Vision Language Models are Biased","version":4},"cited_work":{"arxiv_id":"2505.23941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23941","snapshot_observed_at":"2026-07-10T09:37:00.792500Z","title":"Vision Language Models are Biased","venue":"cs.LG","work_id":"7d4732f2-a4b0-4c6c-b9aa-6110e1f519cc","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.23941","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ba1b919a73656fe6aa327ad9b9109943b8f5637baca2c372b47e4c449d088d68","observation_id":"abc00e6f-8205-4830-9a9e-4daf195e6366","resolution":{"observed_at":"2026-07-10T09:37:00.793694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.200663Z","title":"Inksight: Offline-to-online handwriting conversion by teaching vision-language models to read and write.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"9a24d471-4357-4546-9942-586024651ed7","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:72b7f559f4564f104cb4e3a9c696a6865dc05c45e03e9825f7705ab86a1e42a1","observation_id":"f7218e6a-85a1-4acb-ad60-dfa0b667a7f0","resolution":{"observed_at":"2026-07-10T09:37:01.201949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.253571Z","title":"Inkslop: Vibe-coded benchmark for spatial reasoning with digital ink, 2026","venue":null,"work_id":"0d37f831-624a-4d7b-bb53-f261daf8dc6d","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:28a1912de7ac19d4924c961127bc1fbee060697fed22a39fd872d21d3589fac1","observation_id":"c5f6d51d-54c6-4cc5-8836-8efc93655c12","resolution":{"observed_at":"2026-07-10T09:37:01.254722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.09713","last_updated":"2020-06-25T06:38:53Z","snapshot_observed_at":"2026-08-22T22:51:51.976592Z","submitted_at":"2019-12-20T09:32:41Z","title":"Measuring Compositional Generalization: A Comprehensive Method on Realistic Data","version":2},"cited_work":{"arxiv_id":"1912.09713","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.09713","snapshot_observed_at":"2026-07-10T09:37:00.864528Z","title":"Najoung Kim and Tal Linzen","venue":"cs.LG","work_id":"affca336-73c5-4192-9e27-b887f212cd11","year":2019},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/1912.09713","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:728f2646811dd9aac33fc84fd4e9027b458e69379d61492b4c8441b150d1a08e","observation_id":"530aaa96-94cc-48fb-bb25-26a5d7b4347f","resolution":{"observed_at":"2026-07-10T09:37:00.865769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:00.768353Z","title":"Scaling can lead to compositional gener- alization.arXiv preprint arXiv:2507.07207, 2025","venue":null,"work_id":"37162369-5fcf-4e98-b45c-5be3e962d3cc","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:e71f1e2a001a53334f88905dfed65ec856a494c62fb002cad36cef01a801b79a","observation_id":"1bb143d9-7b11-472d-a777-f4f6912acf8f","resolution":{"observed_at":"2026-07-10T09:37:00.769972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05766","last_updated":"2018-02-15T21:16:59Z","snapshot_observed_at":"2026-08-15T06:59:08.861429Z","submitted_at":"2018-02-15T21:16:59Z","title":"Learning to Count Objects in Natural Images for Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1802.05766","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.05766","snapshot_observed_at":"2026-07-10T09:37:00.805098Z","title":"Learning to Count Objects in Natural Images for Visual Question Answering","venue":"cs.CV","work_id":"518a32d3-4b87-4774-ae3e-e5763f7a62ec","year":2018},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/1802.05766","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c25bd9686fb88c8d0c926e0dfc662bed7828ab76a518389c5afc51415b3ea3f2","observation_id":"3e329f58-ac1b-428a-8256-e254c68f0d50","resolution":{"observed_at":"2026-07-10T09:37:00.806324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v33i01.33018076","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tallyqa: Answering complex counting questions","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"4938138e-5b36-451c-9fc3-2f4959afc75b","year":2019},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ce39b76a93a6e677cc05219f85bceaa5eab1769ce29dcb2c8ef18da96d401055","observation_id":"d4f8a6d8-75fe-4d04-9d06-7a577d1618bf","resolution":{"observed_at":"2026-07-10T09:37:00.713335Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:20.320447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:20.320447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15722","doi":"10.48550/arxiv.2511.15722","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spatial reasoning in multimodal large language models: A survey of tasks, benchmarks and methods","venue":"ArXiv.org","work_id":"6a89950e-e68f-4ee1-92ca-4c617487ec7c","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:93654c71e517307a8a442156ad2dfec09a03ffa12865f04f4e06e434b9739d78","observation_id":"32d03d1e-7a59-40fd-acae-88b99c342c51","resolution":{"observed_at":"2026-07-10T09:37:00.820846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.193973Z","title":null,"venue":null,"work_id":"060809c3-c70f-4d9b-b00d-8d378002bddd","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:db5ab8a05c710e9d42c59c490b0c9dc4f5e1eff0812d6b7ccf9437a6f6d30dbb","observation_id":"9409d0a3-64a0-4482-bbab-a83c034dd832","resolution":{"observed_at":"2026-07-10T09:37:01.195107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00545","last_updated":"2021-11-02T19:12:12Z","snapshot_observed_at":"2026-08-16T18:20:51.077477Z","submitted_at":"2021-05-31T14:39:38Z","title":"Counterfactual Invariance to Spurious Correlations: Why and How to Pass Stress Tests","version":3},"cited_work":{"arxiv_id":"2106.00545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00545","snapshot_observed_at":"2026-07-10T09:37:00.797725Z","title":"Counterfactual invariance to spurious correlations: Why and how to pass stress tests.arXiv preprint arXiv:2106.00545","venue":"cs.LG","work_id":"369ae891-c73f-4984-813c-d885f1f99c61","year":2021},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2106.00545","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:25e776659df8300163245127715a7174ca93a782124d841a72a7d5e2ec3978a6","observation_id":"a7bb48b5-0540-4a8c-b251-485b6c798b6c","resolution":{"observed_at":"2026-07-10T09:37:00.798951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.198998Z","title":null,"venue":null,"work_id":"c2c880b6-7c4a-4855-bd52-a25e32d16ef4","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:6358ea58f285dd8b97b6d3871adf3e7b69afa871a99ed7e6207170a6cbfbbdb7","observation_id":"aea1cd86-5799-4482-8ea5-d8d4e90d308b","resolution":{"observed_at":"2026-07-10T09:37:01.200122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.197384Z","title":null,"venue":null,"work_id":"fcc9eb61-ab30-4ff2-af5b-e110219c62b2","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5a96cf0b370d5a8c2e6667b907951d04de9b10a0f69a63207ac18505d8dee04c","observation_id":"1fe88e11-1c9c-4851-a48d-b54a5d26e327","resolution":{"observed_at":"2026-07-10T09:37:01.198490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.195670Z","title":null,"venue":null,"work_id":"2cba6c06-c303-42e1-b626-e74348ad8ce2","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9677c89b965e427dfbd4cd517bbcd90e661ac182b673c24614d6840e5b631ee3","observation_id":"ed07be03-519f-4683-8cec-693cf8e8f640","resolution":{"observed_at":"2026-07-10T09:37:01.196836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.223127Z","title":"C\" for CORRECT: The generated image satisfies the task requirements -","venue":null,"work_id":"dd33523d-ebde-43d8-8935-97ca52a5d64a","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:15c0ca62b23fdeef56cf8ce7406a06728293bc6fc9e3e6707bb94c7b5a23b680","observation_id":"5c002943-c9d0-4b32-ad42-9e90ace31818","resolution":{"observed_at":"2026-07-10T09:37:01.224324Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":4,"verified_exact":37,"verified_fuzzy":30},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2607.08317."}