{"as_of":"2026-08-10T07:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f0607cefaf62cb9a4773c7c45706060aba66f23853cdec088fd56723dc6db35","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:50:34.081389Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T06:34:56.032634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T21:11:15.085382Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2505.20728","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20728","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ahmed Masry, Xuan Do, Joty Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":"d4e78e9a-411c-4479-80f1-11dfc17851ad","year":null},"citing_paper":{"arxiv_id":"2604.23813","last_updated":"2026-04-26T17:26:06Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T17:26:06Z","title":"ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T06:34:56.032634Z"},"links":{"cited_paper":"/paper/2505.20728","citing_paper":"/paper/2604.23813"},"observation_digest":"sha256:576eb6858e211b73d7727e10f2d55934e52833abec681723dedc5ff98f33eb3c","observation_id":"af191167-4ede-47cd-87e2-f3dc88dfe650","resolution":{"observed_at":"2026-05-11T21:11:15.133893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20728/citation-record","integrity":"/paper/2505.20728/integrity","json":"/paper/2505.20728/citation-record.json","paper":"/paper/2505.20728"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:30.566175Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.566175Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:75bd3f83b41618037a3f24d5a38fa4feb282ef0d72b59287447757b7e12e90cf","observation_id":"5c399578-31b0-470e-9f41-1b4bc570dda5","resolution":{"observed_at":"2026-08-07T13:50:30.566175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:30.634571Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.634571Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:139874a6cc02c2fbb9f234b463722c4f27cfce951e0dba2025856da006c42b2b","observation_id":"9d151fad-124c-448c-802b-279daa1da518","resolution":{"observed_at":"2026-08-07T13:50:30.634571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T13:50:30.732806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.732806Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:48dccbc8b70f99389e806db92c4eba8f71a3aafc213746b6a5f4e7b2270fbe5e","observation_id":"b7040f26-b49f-46db-9f98-0ba1569ab0bb","resolution":{"observed_at":"2026-08-07T13:50:30.732806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:50:30.813020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.813020Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:17d29ead668ca2ca5243648b647275295b10392e38ba9cb559b9d5bc69fec5a1","observation_id":"752de2f1-8c9d-4fd0-b9d1-e72e290aab7a","resolution":{"observed_at":"2026-08-07T13:50:30.813020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:50:30.868504Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.868504Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:db5bf6209ce8ad61302dfda05626be9d4f6ba6e8a73449ad7442ef0e8003544f","observation_id":"915d26d0-19a8-4d7f-8af0-09413637133e","resolution":{"observed_at":"2026-08-07T13:50:30.868504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:30.952646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.952646Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:b82dcff9005317d7eff65c87536035f8c1e5b1dda750e531ac5b22f7ebe1d709","observation_id":"a998c525-c809-401b-a93c-920b0ea44347","resolution":{"observed_at":"2026-08-07T13:50:30.952646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:50:31.034463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.034463Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:0e0cc9054e799678ba6a9d280efe3d1006840f72ccf2d1103d3bd6ba4582edf6","observation_id":"5d9339a7-f16c-43db-b718-064548533b5c","resolution":{"observed_at":"2026-08-07T13:50:31.034463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:36.230078Z","title":null,"venue":null,"work_id":"c998ffea-b1d9-4baf-80f6-8e85f38e5842","year":2023},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.115810Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:c2a177e15a9aa9d1cf0603a0c2c819c4bd468724c0cfc7fc36e178dddf347e34","observation_id":"18f9b066-a05a-4a05-8efe-ba769070c060","resolution":{"observed_at":"2026-08-07T13:50:36.299628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:36.073947Z","title":null,"venue":null,"work_id":"3ba6b303-884e-46db-a279-37f4bf4c0ba0","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.165621Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:e84b81e38d99bc2875c1d45a52ea45a573b812d052313ed7e045883d9b937ce7","observation_id":"83229649-630f-4331-9b98-ad31b15475fc","resolution":{"observed_at":"2026-08-07T13:50:36.156624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08751","last_updated":"2025-05-13T17:03:48Z","snapshot_observed_at":"2026-08-08T14:41:38.021739Z","submitted_at":"2025-05-13T17:03:48Z","title":"Aya Vision: Advancing the Frontier of Multilingual Multimodality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08751","snapshot_observed_at":"2026-08-07T13:50:31.236941Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.236941Z"},"links":{"cited_paper":"/paper/2505.08751","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:6e5c7260f2778793034d0645a05c96d39b9a5d41ea6953110d1276bec65a3845","observation_id":"0b6d4f18-972e-4d8c-b198-074d5dd7cb52","resolution":{"observed_at":"2026-08-07T13:50:31.236941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T13:50:31.301410Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.301410Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:efe5f7ffee37dff21cbb2872e2669cb87b5b8e601b7203086e392c4dfcda70c4","observation_id":"88c75eb4-923e-4bb7-bbb5-8cb2c3f30022","resolution":{"observed_at":"2026-08-07T13:50:31.301410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.877390Z","title":null,"venue":null,"work_id":"30288e1f-08fb-47fb-9593-95f2c8c0853d","year":2018},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.377792Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:fd0684e6879f0c720034303b4b81d86c3441ef3242c9a03ef8a83018f3ac5f18","observation_id":"d67f9f9f-cb3a-43ab-87b8-be3144fcc46f","resolution":{"observed_at":"2026-08-07T13:50:35.970655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T13:50:31.444781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.444781Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:2eb828770f33ec0bbc8d575524664526053cde8df42d87322b9ed1edc8f6231a","observation_id":"4b860dae-a052-4a8b-bf93-b134355876e7","resolution":{"observed_at":"2026-08-07T13:50:31.444781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.692687Z","title":null,"venue":null,"work_id":"633dafdd-53c6-4114-8cdb-c54fcf811f87","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.516823Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:bc8571b6774655ff36c7e1260fee8dc82628db1f3396f52a3a09112b1a980024","observation_id":"1e2bdc44-4582-4ee6-866a-cbbed726afb1","resolution":{"observed_at":"2026-08-07T13:50:35.779086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.488255Z","title":null,"venue":null,"work_id":"885d7f23-7c63-4f2c-9736-c81e98751136","year":2021},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.595020Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:c4875e5e84b3c90142532a932a6d3896a5803537c15e17e989dde96b4830f2a0","observation_id":"56b1f494-4cca-4dd8-8989-6add8b57b1e8","resolution":{"observed_at":"2026-08-07T13:50:35.590650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.686596Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.686596Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:3a0af10b8b722b88e669024415ef6cf3c30de75229d6b8d9ebb9c666ecf9eafb","observation_id":"06300119-8468-4e4b-b66c-f7cbd0fe8a1f","resolution":{"observed_at":"2026-08-07T13:50:31.686596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.769097Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.769097Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:d308edfd72c7b9f9ce2cfe078842502f4469cfd499dd58fb75de540d0aebf175","observation_id":"8d8cc75a-6a49-4d13-b764-86b738695d19","resolution":{"observed_at":"2026-08-07T13:50:31.769097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.864485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.864485Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:27bfd9af02a445df2672adef3d0feb1cbdbef2a2852fc41f5bcca9b059f0961a","observation_id":"1751a488-47f6-463a-95ee-3434fdd5a170","resolution":{"observed_at":"2026-08-07T13:50:31.864485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.905490Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.905490Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:0eee0d6f7947714e7cc45187cb271739f11e76cacc3e05ef99b62eb446374d26","observation_id":"98096c57-9bd8-444f-a72b-8ac62487f656","resolution":{"observed_at":"2026-08-07T13:50:31.905490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.978776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.978776Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:d0020cec3592bbab6b5ff08b8516746bcfc15bbb922df08be17aba2d530ade02","observation_id":"8835969b-b7aa-46d7-ab34-527f0d1550ba","resolution":{"observed_at":"2026-08-07T13:50:31.978776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.068720Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.068720Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:ea2a6de852d0003b8f24e4dac90373ff6fddb121c9edd9aa9a06b987b545a5e5","observation_id":"e95c8114-bbb1-485f-a17f-6ce584870e4e","resolution":{"observed_at":"2026-08-07T13:50:32.068720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.240284Z","title":null,"venue":null,"work_id":"b90d1d79-c6ec-4d44-9e2f-f52dbfab665e","year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.171204Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:01d4999fffc29b2de087158384922a8763c140f397113ba3650bb3a797c5c2e1","observation_id":"001d6cb3-83f1-49ba-98c9-d03602fda910","resolution":{"observed_at":"2026-08-07T13:50:35.334929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.091615Z","title":null,"venue":null,"work_id":"6d237d31-56b2-479c-a84c-ab8ccf324f00","year":2016},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.242418Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:58a60b4e00a5ff641f0df845019135d6119648f7a42f562eec528ce3acdf2081","observation_id":"601b543a-3e8e-40a9-ba87-49474f2fca34","resolution":{"observed_at":"2026-08-07T13:50:35.138981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-08-07T13:50:32.315784Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.315784Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:ce063bb05311c45584733c9bc766ba5a1b57447a2df00d660db1643e67b212f1","observation_id":"0f972e68-e574-42ee-a6ed-21d647e6ff52","resolution":{"observed_at":"2026-08-07T13:50:32.315784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:34.985153Z","title":null,"venue":null,"work_id":"d2b43e61-d906-434a-9a28-af8f892d1662","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.389330Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:09556c459cd540b5cc12b4c8da8e367e0c624fe1194972edcf2f055a5bcfebb2","observation_id":"ead65715-e649-4dca-b20c-e1f20b6c4f0f","resolution":{"observed_at":"2026-08-07T13:50:35.032708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.470962Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.470962Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:964dffdf2d74fd95e4b5e74c2b2453ecd4cd73a8401046af43e05df899db8c1f","observation_id":"5c97cc13-0618-4740-880f-af2c42d94a96","resolution":{"observed_at":"2026-08-07T13:50:32.470962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23064","last_updated":"2025-04-02T07:10:05Z","snapshot_observed_at":"2026-08-08T13:40:25.733363Z","submitted_at":"2025-03-29T12:50:38Z","title":"VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23064","snapshot_observed_at":"2026-08-07T13:50:32.535373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.535373Z"},"links":{"cited_paper":"/paper/2503.23064","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:4d99b2ddba9f25ee2ac0729121184170d60366c9529c3bb68032ad3081c5a8df","observation_id":"ffbe223e-d9c3-4ae9-9117-c5fa30c22be1","resolution":{"observed_at":"2026-08-07T13:50:32.535373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T13:50:32.608633Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.608633Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:de04e0bd7dbd71046ed3341ca4c4aa66a17f69dadd248881149f2f36d038ad33","observation_id":"dfb006dd-2a19-4373-a98d-e6b997626f22","resolution":{"observed_at":"2026-08-07T13:50:32.608633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.676073Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.676073Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:4daa23e8dcf81e9dbab797e05451254f9f344ffee1b9b25de95d334be1e415ab","observation_id":"874f6b88-88ce-4ec7-a840-424a733f8385","resolution":{"observed_at":"2026-08-07T13:50:32.676073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:34.837257Z","title":null,"venue":null,"work_id":"dbd5191e-29ed-421a-bac5-76ae9af078a7","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.758845Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:4ccde956eaad0479a1647990e09fc16930553a023aae23a0d917c9632b632a98","observation_id":"4eae3f36-1e9a-4657-b9a4-c3b516b3d359","resolution":{"observed_at":"2026-08-07T13:50:34.893955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.851572Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.851572Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:cadc4715fd0a3e5234c7198ba4039919228668b743b83a38a2525c5fbe6a7b60","observation_id":"62794210-eb1e-45bc-b7fd-b271d7ac7dc9","resolution":{"observed_at":"2026-08-07T13:50:32.851572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-07T16:05:50.340309Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-08-07T13:50:32.927998Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.927998Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:a220b98058f8153dada24dc25c08e8d72a5eec865e2d8752466920a161e9602f","observation_id":"dc85e25c-5131-46e0-a594-a8fb0bacfe77","resolution":{"observed_at":"2026-08-07T13:50:32.927998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-07T16:38:11.702011Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-08-07T13:50:33.010530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.010530Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:904f0e68479f7d44da668fccfb69b6d3f8c2b2b352ac9558348fb5e70a45e44a","observation_id":"fc5d705f-b0e8-4de9-a506-d73312103c29","resolution":{"observed_at":"2026-08-07T13:50:33.010530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19990","last_updated":"2025-06-20T05:50:00Z","snapshot_observed_at":"2026-08-07T16:37:24.241241Z","submitted_at":"2025-03-25T18:21:07Z","title":"LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19990","snapshot_observed_at":"2026-08-07T13:50:33.120737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.120737Z"},"links":{"cited_paper":"/paper/2503.19990","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:e7155e0f4359a4c46596c40187786b3d4c23cf4fae75527dea4e62676ca917e5","observation_id":"f462880d-35a6-456c-a477-9290ac0be834","resolution":{"observed_at":"2026-08-07T13:50:33.120737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12522","last_updated":"2022-10-10T10:39:10Z","snapshot_observed_at":"2026-08-02T04:06:04.677348Z","submitted_at":"2022-05-25T06:30:19Z","title":"Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12522","snapshot_observed_at":"2026-08-07T13:50:33.214128Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.214128Z"},"links":{"cited_paper":"/paper/2205.12522","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:6fb66db0974706e57cc9eb53a2b581e1f7140389b28279014420351f458945a6","observation_id":"d5a87d20-629c-4fed-a2ca-1aa7cc8a503d","resolution":{"observed_at":"2026-08-07T13:50:33.214128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:34.684844Z","title":null,"venue":null,"work_id":"240d5320-bb9b-48c9-960f-4046c5f2daac","year":2022},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.357115Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:c6fb20c8eda14d5580aa9b5507019b182391250421a6f165847b37de4d53d920","observation_id":"cf46d1fe-c7ad-4a60-ae0d-05f05bc2541a","resolution":{"observed_at":"2026-08-07T13:50:34.743151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:50:33.477473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.477473Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:7cbbc3d296dd7e043715289bcaa90797221a923a7003ca313afda96c9b21903c","observation_id":"5594654b-632a-47ac-b866-0c18d131b687","resolution":{"observed_at":"2026-08-07T13:50:33.477473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09150","last_updated":"2025-02-12T03:00:20Z","snapshot_observed_at":"2026-07-06T19:01:49.900679Z","submitted_at":"2024-08-17T09:49:40Z","title":"CogLM: Tracking Cognitive Development of Large Language Models","version":3},"cited_work":{"arxiv_id":"2408.09150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09150","snapshot_observed_at":"2026-08-07T13:50:34.238328Z","title":"CogLM: Tracking Cognitive Development of Large Language Models","venue":"cs.CL","work_id":"15ab9af6-3b82-469d-8c1e-f46612e72ea0","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.577929Z"},"links":{"cited_paper":"/paper/2408.09150","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:0d0a53c511dba9248202e34450dac0de9f2fbe4206846c3587eeec5c0798d089","observation_id":"537d74e7-7f34-4249-9156-1de218b34bdc","resolution":{"observed_at":"2026-08-07T13:50:34.334219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:33.703965Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.703965Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:515ba53afc1824fd6ac85f7374d25a4123c3c68b50b63f8eb9bb01a4261c09d4","observation_id":"1633c790-48b4-4a8f-ad8c-b011cab5840c","resolution":{"observed_at":"2026-08-07T13:50:33.703965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:33.819280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.819280Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:2c5ec3f193ee3de02cdbfec10db7c7df9770e4fbf8f99243d4930b4582348dd9","observation_id":"ae6ea074-f45a-4264-af88-2e2f6d623eb0","resolution":{"observed_at":"2026-08-07T13:50:33.819280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13953","last_updated":"2025-05-28T08:41:02Z","snapshot_observed_at":"2026-07-06T20:25:12.962104Z","submitted_at":"2025-01-20T08:09:42Z","title":"Redundancy Principles for MLLMs Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13953","snapshot_observed_at":"2026-08-07T13:50:33.938748Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.938748Z"},"links":{"cited_paper":"/paper/2501.13953","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:d37975bd24971a9c9bf2c7c55140d5a31e31138da0f7ca27e4ebefab7ac19741","observation_id":"01d53ced-5ee7-4b5e-b343-a35ca024c4f8","resolution":{"observed_at":"2026-08-07T13:50:33.938748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:50:34.081389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:34.081389Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:d9dc8088540ad4484f27ac7d5367ec0a3ddbf23ee391c5083608215756f7ab1f","observation_id":"d9652d4f-5803-404f-bfbe-04cbc5d6017a","resolution":{"observed_at":"2026-08-07T13:50:34.081389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2505.20728."}