{"as_of":"2026-08-12T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b4189a4ed0529f6b3e7d2e6125838f869e7c6f1fd958faca4cee9b0fc944898","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:51:06.202263Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07297/citation-record","integrity":"/paper/2507.07297/integrity","json":"/paper/2507.07297/citation-record.json","paper":"/paper/2507.07297"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:03.420164Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.420164Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:7b0c052d2c80d09a6c29679a95f43f46307c249b9ce0b2af0fcc833757493267","observation_id":"01079c24-8587-41b4-9ee6-5a8b73321352","resolution":{"observed_at":"2026-08-06T18:51:03.420164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.810101Z","title":"Introducing the next generation of claude","venue":null,"work_id":"aca2e51e-eed9-488a-8bfe-ce223c24d103","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.478021Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:ee6495514e51a213de2779576b657e74b2e614a2bcf378ee6d462c259d2ed987","observation_id":"4adc7ce3-70be-4142-8439-c3db538f8671","resolution":{"observed_at":"2026-08-06T18:51:08.910433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:51:03.544169Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.544169Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:4459118e29872b755e090a11911ff37f96ff0521c150b503aa91d33251554d65","observation_id":"a287fb6c-90de-4f06-9964-f737307741be","resolution":{"observed_at":"2026-08-06T18:51:03.544169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T18:51:03.629099Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.629099Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:39524148f9e491ccce9d28a7e81020dbb37c99e86f85eb1389f60cf5b3da1344","observation_id":"e5658769-623e-418d-8a07-f020d37f21a0","resolution":{"observed_at":"2026-08-06T18:51:03.629099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.659267Z","title":"AiR : Attention with reasoning capability","venue":null,"work_id":"9a0ca0f2-0b68-48dd-9ab5-33edc63dc458","year":2020},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.686648Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:d2676f822b6f9ff3333e6ea7bce13f605114e6aadf355e6ac5a12500b5f94d3b","observation_id":"847a7c53-0ffc-4be9-b655-69daa69edf73","resolution":{"observed_at":"2026-08-06T18:51:08.713385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:03.766806Z","title":"Measuring and improving chain-of-thought reasoning in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.766806Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:fb76f9a17f13c2f3ce6b37e84b197cc2c5118e9a104bb6705fef53e5c30b7167","observation_id":"26524540-6843-4f25-8d64-d6d90b3161f9","resolution":{"observed_at":"2026-08-06T18:51:03.766806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-08-10T21:35:59.413244Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-08-06T18:51:03.841863Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.841863Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:3f6f32898da2dfb9e609d1feb0d7a56cdfe01198c52ba406b8a9ae1606d9ac98","observation_id":"f50ac4c8-1124-4a79-b6c8-e32f1c9947e9","resolution":{"observed_at":"2026-08-06T18:51:03.841863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.489665Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"1d18c4a2-7e37-46d0-b2fc-b2523677a310","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.907226Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:e9c4a2298dcbf9baeaa5c2f44d6d9e4ac0e5c5105239fc43106719579d55c264","observation_id":"f08cb58b-885c-473a-b805-4942db340f1d","resolution":{"observed_at":"2026-08-06T18:51:08.565046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.337884Z","title":"Aya-vision model card","venue":null,"work_id":"ddf36199-b851-4518-adac-08f21a8f75a3","year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.976013Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:1703f4a967fb8c68656b8c4f58424d2bc586254870ef9204cbf7b73b475f1d58","observation_id":"4de4e951-11d1-4b5b-8837-207ab0b1cd12","resolution":{"observed_at":"2026-08-06T18:51:08.411182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T18:51:04.037683Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.037683Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:c7f50fa4b8e5799eeef663f99bbbe5611f4535a3ae2a1ddfbfbc098feecb3c6e","observation_id":"9428915f-571b-493d-8bd4-4e9c9f3684c4","resolution":{"observed_at":"2026-08-06T18:51:04.037683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04554","last_updated":"2023-12-07T18:59:22Z","snapshot_observed_at":"2026-07-06T16:58:32.099526Z","submitted_at":"2023-12-07T18:59:22Z","title":"Improved Visual Grounding through Self-Consistent Explanations","version":1},"cited_work":{"arxiv_id":"2312.04554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04554","snapshot_observed_at":"2026-08-06T18:51:06.923632Z","title":"Improved Visual Grounding through Self-Consistent Explanations","venue":"cs.CV","work_id":"7d4dec86-3c3c-41ec-b99b-f84ec36e2e03","year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.109878Z"},"links":{"cited_paper":"/paper/2312.04554","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:2a550d69461448569ff0b946670b801512c90c0c741209b191c44f87af60d1e7","observation_id":"803f8c99-c8b1-4ea9-aa9e-dd8cd31a484e","resolution":{"observed_at":"2026-08-06T18:51:07.033159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.168260Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"ad75e6ef-7b72-4393-adc7-9501f9e64959","year":2019},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.201246Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:aae530c6bdb5781a6d2246df2670da6b9919578280d1024cbe17485166cb5814","observation_id":"a94447db-402c-4f07-9daf-f7be8ed79e9b","resolution":{"observed_at":"2026-08-06T18:51:08.229609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T18:51:04.289982Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.289982Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:c53c15009d28dc362fc74cda6e732c18f7f0b267c1ba4e9b87837b16d9c8dff1","observation_id":"4bfa830a-d607-4b6d-a050-a712d764dd7a","resolution":{"observed_at":"2026-08-06T18:51:04.289982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-19833-5_38","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Weakly supervised grounding for vqa in vision-language transformers","venue":"Lecture notes in computer science","work_id":"42b3b64a-8c3f-4ba6-812d-039070d726ec","year":2022},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.365691Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:6a0cfd42c83b2bedb6f00e6249195cd2f5dd9fc9b6e7491d5ce5e7f3f362de80","observation_id":"c891e4df-803f-47e8-89ec-cdb9b2b70354","resolution":{"observed_at":"2026-08-06T18:51:06.522495Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T18:51:04.420426Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.420426Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:d7a1320fa2387d4e8513f5640ab008706cd454b7777ff5a932dea88ced9ede0d","observation_id":"89a1cba5-0ab5-4c6a-8fa0-fe426fcdecb7","resolution":{"observed_at":"2026-08-06T18:51:04.420426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T18:51:04.468078Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.468078Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:e460dbe8f1427394f1a5bb6ca9fcba82f720de6a862a4340d5c91483be8413e2","observation_id":"2cc45b3f-a014-47a5-9625-f7b95e3a6b91","resolution":{"observed_at":"2026-08-06T18:51:04.468078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.023176Z","title":"Visual instruction tuning","venue":null,"work_id":"ff7dea8e-6382-439b-88d1-4bbd66bcb7fd","year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.531795Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:8fa36fcba652e947739b35d0b5fa4815df3da62ecba4130b7019b161aa330d9d","observation_id":"bc1c45f8-a047-46a9-a055-0e97c45ce61a","resolution":{"observed_at":"2026-08-06T18:51:08.068541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:04.586706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.586706Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:97d447012454be4584808d3d8f666ffad194ee492e7bcc84e36c1720857a4a5a","observation_id":"6de4a6e7-42da-4ea2-888b-26422013531a","resolution":{"observed_at":"2026-08-06T18:51:04.586706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:04.654427Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.654427Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:2f92ee5ec67201afb3063f748ead0e51b74731698fdf44386618e6b469ac2384","observation_id":"7d3d5810-42b4-4185-abcb-0427d493b7b5","resolution":{"observed_at":"2026-08-06T18:51:04.654427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14562","last_updated":"2024-06-20T17:59:45Z","snapshot_observed_at":"2026-08-12T03:53:24.118771Z","submitted_at":"2024-06-20T17:59:45Z","title":"Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14562","snapshot_observed_at":"2026-08-06T18:51:04.723812Z","title":"Whiteboard-of-thought: Thinking step-by-step across modalities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.723812Z"},"links":{"cited_paper":"/paper/2406.14562","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:39f4b10e9f5e718350790d6470c49608274f6c396f86e55d5b8b43b6781b281a","observation_id":"3326c16b-02c8-4888-a0f1-2431d76235b4","resolution":{"observed_at":"2026-08-06T18:51:04.723812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:04.807420Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.807420Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:6f277082a994ed0cdc9f8f1129b42d6aad3313c4419fda766fc136712f9eac55","observation_id":"de87c41c-c010-4906-bd35-c2f9d1377340","resolution":{"observed_at":"2026-08-06T18:51:04.807420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.853332Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"86e19a18-8d8d-4dda-b490-fb4e07eb66f4","year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.872081Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:74260da6fcd5e66c6f99afc5f326e31168106e63cfbe1a2f39a68a41d3aa644c","observation_id":"ced51df7-21a3-40f8-bc0b-9a2d7e1cd7f0","resolution":{"observed_at":"2026-08-06T18:51:07.933231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.702533Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":"ad526af0-d150-4bc1-8692-315752cca9e8","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.903213Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:e75e4c7f3ce8e31194f9be40506b630b7928b2c01b7b2acaf51ef37e9437799d","observation_id":"73f51922-0f6a-4e14-b238-55e7ff329eb9","resolution":{"observed_at":"2026-08-06T18:51:07.766881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.241","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Uncovering the full potential of visual grounding methods in VQA","venue":null,"work_id":"1171e198-60b1-445c-b8ee-fb5a151978c9","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.962971Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:d49dd93d789e97ba2a4ac6f9347b225238f1c53848a2a85e705b398524a4f376","observation_id":"52598951-ae8e-4590-9c5c-23e5980ed9d9","resolution":{"observed_at":"2026-08-06T18:51:06.383863Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-08-11T20:28:41.911819Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-06T18:51:05.057773Z","title":"Visual chain of thought: Bridging logical gaps with multimodal infillings, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.057773Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:dbfdb27329b0b78eca7c990320cf9c2166a6a89ebe37fce3bb18ef5cd3b33689","observation_id":"e1e41564-69ac-402c-b641-dd779435f174","resolution":{"observed_at":"2026-08-06T18:51:05.057773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-06T18:51:05.113854Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.113854Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:b4daa16efdb54ccd86732b867e79e78616443dc5080766a6e4b396100ac2925f","observation_id":"7264deb3-fdc8-413f-8112-00ef15330c3f","resolution":{"observed_at":"2026-08-06T18:51:05.113854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T18:51:05.213221Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.213221Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:46d1310ee00d84288f50b6eb32ebb94ea77e4889f64fdb3d56134e85d415ff48","observation_id":"3e314ea3-e67d-44e2-9326-95c0ef7349ea","resolution":{"observed_at":"2026-08-06T18:51:05.213221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-10T21:03:22.633699Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-06T18:51:05.257142Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.257142Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:a348fdb01cfa5129466a70e15a402cb8d5f3a6000a9546c304c55292bcb1ff9a","observation_id":"391d53de-c277-45ab-848a-cf4e971f8c19","resolution":{"observed_at":"2026-08-06T18:51:05.257142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:05.326894Z","title":"Contrastive region guidance: Improving grounding in vision-language models without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.326894Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cc9035afac6e82165b93a981963d53ea10718195c093342f3841d42c72a9aaed","observation_id":"51ec8827-b6fb-4c75-a226-2429fe40ba5e","resolution":{"observed_at":"2026-08-06T18:51:05.326894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T18:51:05.402887Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.402887Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:9a2388f0d28762d83d8ace07e92601fb5b7e304e17f9fbc0d49603d4e40dc663","observation_id":"2fa00a24-98fb-41ab-a6ca-c0a1990eabe7","resolution":{"observed_at":"2026-08-06T18:51:05.402887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02172","last_updated":"2025-03-18T08:02:22Z","snapshot_observed_at":"2026-08-11T23:43:30.014983Z","submitted_at":"2024-12-03T05:04:49Z","title":"VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2412.02172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02172","snapshot_observed_at":"2026-08-06T18:51:06.705524Z","title":"VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning","venue":"cs.CV","work_id":"3094a2a1-fdd2-43fc-8da0-753665a9488e","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.455071Z"},"links":{"cited_paper":"/paper/2412.02172","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:e3c05e297cba7aba84dbb223093f84dc457b17991589f6bfbf1196400550b4f9","observation_id":"2430184c-629d-4eec-8bc3-f9736569496e","resolution":{"observed_at":"2026-08-06T18:51:06.738821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.535669Z","title":"Llava-onevision-chat: Improving chat with preference learning, September 2024","venue":null,"work_id":"53deac1e-bd26-4c65-875f-793d8aa4a562","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.525846Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:83785d2dd77cd2753a09f0e7a1343cf089387c84c11c5ba7cf6c3220d787c866","observation_id":"62e285fa-da03-4007-b4f9-e48be3f54dcf","resolution":{"observed_at":"2026-08-06T18:51:07.629867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T18:51:05.654601Z","title":"Llava-cot: Let vision language models reason step-by-step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.654601Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:4f56def08d70eb6078f52d82ba315412d47d4133d928cb45b8463e75abd6f905","observation_id":"b0d75234-27f1-4d5f-b1e7-762272879e96","resolution":{"observed_at":"2026-08-06T18:51:05.654601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15462","last_updated":"2024-01-07T00:24:21Z","snapshot_observed_at":"2026-07-06T13:26:33.250328Z","submitted_at":"2022-06-30T17:55:12Z","title":"Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15462","snapshot_observed_at":"2026-08-06T18:51:05.755348Z","title":"Improving visual grounding by encouraging consistent gradient-based explanations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.755348Z"},"links":{"cited_paper":"/paper/2206.15462","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:9bd9d7a4024d26518786d9de75589464f4c8dac1018b12877fbfdb08d2b6f81c","observation_id":"08cec980-e5df-487c-a7a2-2e261c508c7b","resolution":{"observed_at":"2026-08-06T18:51:05.755348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.408176Z","title":"Mm-vet: evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"4a22a0f4-f0a7-4475-9a68-429f82495a16","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.824802Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:70f7fdb97d121e4276d537f40453724908636c18d81bc69e14b0d04ab5346cda","observation_id":"a99c0d05-b26f-4792-a42a-7dc8685f882a","resolution":{"observed_at":"2026-08-06T18:51:07.478808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.254801Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"c0f0d80f-ce10-4735-9063-2277c768d796","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.946191Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:ea873ba55c90ca5d2731b8d2a58ffb26d6cc8aa97f89dc92d11c91eda0dae0da","observation_id":"3d4c7102-8b8d-4b1d-b41b-10db977a64f9","resolution":{"observed_at":"2026-08-06T18:51:07.321052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-12T00:22:35.932487Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T18:51:06.064596Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:06.064596Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:e2f2c08b43f37e1fc92ac135689863b49a093a4afe23716d1c8d44ca7c0ee62a","observation_id":"ca938052-b05d-4806-b200-a1166d0a1387","resolution":{"observed_at":"2026-08-06T18:51:06.064596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.150286Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":"a4c96cf3-0711-494c-89ab-7a99114a9f61","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:06.133863Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:0156697172bb518d8deb5ea5f8a55cf2f84cdc1254baca3b1e027a342fbb956b","observation_id":"5cc0ad3c-9096-45f9-bb46-c620dd382045","resolution":{"observed_at":"2026-08-06T18:51:07.198965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-06T18:51:06.202263Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:06.202263Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:8ee36d9a37480e58609b87af3c7df9454346a9ec52fdd312c86c16d9fd5a32d3","observation_id":"6a330a3f-c247-42d8-9270-a560a91fd405","resolution":{"observed_at":"2026-08-06T18:51:06.202263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:46:09.743302Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":4,"verified_fuzzy":12},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.07297."}