{"as_of":"2026-08-13T10:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c5d5be87c1e4a9d1fc392cd56c1c37024a131565d041ce8906951b902ec3b2d","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:41:26.959722Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:27:53.149718Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:19:57.696188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-08-11T07:20:28.569646Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:3d37807e9179f67374b58306f0c45718b7d6f32b19d283aeed6eef9e929daecb","observation_id":"cd63e26c-445d-4a10-95c2-ca6f34c69f95","resolution":{"observed_at":"2026-05-16T22:58:38.627648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-08-03T05:23:33.575141Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:33.575141Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:479e9aba87304ebd3bdb83f6168a75b88b69264f03bd50a941a97466b1110b37","observation_id":"69efb2fc-e3d1-422b-aba1-8d09447f2e97","resolution":{"observed_at":"2026-08-03T05:23:33.575141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2602.11635","last_updated":"2026-04-08T16:46:28Z","snapshot_observed_at":"2026-08-11T09:51:37.269833Z","submitted_at":"2026-02-12T06:37:55Z","title":"Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T03:39:28.364183Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2602.11635"},"observation_digest":"sha256:702bdce41862f7b49485c4c895f8c2c84e7265bf7f5e6174b37247af605a8986","observation_id":"6117d801-52b2-4a3b-b5aa-ebf127aeafc7","resolution":{"observed_at":"2026-05-16T03:40:33.064422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2605.22570","last_updated":"2026-05-21T14:48:35Z","snapshot_observed_at":"2026-08-02T20:47:32.000183Z","submitted_at":"2026-05-21T14:48:35Z","title":"VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T07:12:02.612292Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2605.22570"},"observation_digest":"sha256:277f91b135d179b6fb7fa967d0b0b7c4a80204a4f1c708ec2d3417fc933491ff","observation_id":"d511db07-233c-4a58-94fa-4d685ac5172b","resolution":{"observed_at":"2026-05-22T07:14:42.787822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":"2506.04633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-04T16:19:57.696188Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":"52164092-efa3-4259-af54-ade84d61e1b3","year":2025},"citing_paper":{"arxiv_id":"2606.24539","last_updated":"2026-06-23T13:06:51Z","snapshot_observed_at":"2026-08-02T12:19:25.025255Z","submitted_at":"2026-06-23T13:06:51Z","title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:17.094339Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2606.24539"},"observation_digest":"sha256:952be7ae644f4f6dc1a942f4eceb25c23a233f7895c216e7fca238a6997d6184","observation_id":"45cd9437-65a1-4a2e-8d80-bb147c1c1eda","resolution":{"observed_at":"2026-07-04T16:19:57.697686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-07-30T13:52:46.970573Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-10T18:08:28.957671Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-30T13:52:46.970573Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:570b738f8952f8a38193500864dd2a6bff1a2ad560ad2f406a20a90980a9ba6a","observation_id":"d8dd0d06-f4fa-44d6-bcbc-8191e22529af","resolution":{"observed_at":"2026-07-30T13:52:46.970573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-08-05T04:27:53.149718Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-10T18:08:28.957671Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.149718Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:c3fcf74708fa8bd21082c5d7b1730062b83bd94027eea2acf39e05852d798d57","observation_id":"b14b3cb5-72ac-49e0-b444-a6d3609feed1","resolution":{"observed_at":"2026-08-05T04:27:53.149718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04633/citation-record","integrity":"/paper/2506.04633/integrity","json":"/paper/2506.04633/citation-record.json","paper":"/paper/2506.04633"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:37.313592Z","title":"Thinking with sketches","venue":null,"work_id":"f3c52dde-b306-4b13-aecd-188c09067db2","year":2009},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:20.793725Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:13fb9fdc06b57bdd802915b977ad8b06fbc8df43fc739fdcf7489774d09aaba9","observation_id":"0912da52-be3f-4697-877a-14fb9aeea46e","resolution":{"observed_at":"2026-08-07T10:41:37.374078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:37.155657Z","title":"When it all falls down: The relationship between intuitive physics and spatial cognition.Cognitive research: principles and implications, 5:1–13, 2020","venue":null,"work_id":"909bbaae-115c-4d8b-b1a3-2841e6672c9f","year":2020},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:20.885909Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d75a8e0116154d6f877a6df7b44ddbe02f676aa7f397b9a3235264a0c25e5e2d","observation_id":"d951961e-f024-4272-8f90-b59d6863fe5d","resolution":{"observed_at":"2026-08-07T10:41:37.223116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:37.027743Z","title":"Pip: Physical interaction pre- diction via mental simulation with span selection","venue":null,"work_id":"5df88ac6-665a-4d63-bdcb-027d8c99ddfe","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.013328Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:eadd689ff2c7b165575a10bbdca7ca6bc771296ef218f8f70b2e8d6e32c2777f","observation_id":"4714438d-1363-4c42-9ee2-11a8272be7b6","resolution":{"observed_at":"2026-08-07T10:41:37.075925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.909945Z","title":"Spatial ability for stem domains: Aligning over 50 years of cumulative psychological knowledge solidifies its importance.Journal of Educational Psy- chology, 101(4):817, 2009","venue":null,"work_id":"ab89935a-2464-4d84-9311-e04cd3c3d4dc","year":2009},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.133143Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:6d69a3333dbe261ed5934b308e8a9c0690250c25d0d31464d4a4a62655fd4e58","observation_id":"43ecbf05-c71d-413d-b62d-7ad6b7cc771c","resolution":{"observed_at":"2026-08-07T10:41:36.966055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.808795Z","title":"Simulation as an engine of physical scene understanding.Proceedings of the National Academy of Sciences, 110(45):18327–18332","venue":null,"work_id":"e4a9d2e1-0a44-4380-975e-71d6d7049706","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.259948Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:e58242a933257396c7c3a07ee2cf2eaa0fd550c45a1bb13b7e002ae1b1f54de0","observation_id":"196d5666-a9d0-4534-b9a9-66f0d51539cc","resolution":{"observed_at":"2026-08-07T10:41:36.857840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.675023Z","title":"Mental rotation of three-dimensional objects.Science, 171 (3972):701–703, 1971","venue":null,"work_id":"a0bb5c52-c7c0-4dff-a3d3-67162695eadf","year":1971},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.400305Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:70df4807db7975cca58652a0fdaced10058e3b4a9217cc57450b3d9ac9d159c9","observation_id":"6d9429e0-eaa0-4e11-8162-ff16b7d9edca","resolution":{"observed_at":"2026-08-07T10:41:36.727613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.547514Z","title":"Mental animation: Inferring motion from static displays of mechanical systems.Journal of Experimental Psychology: Learning, Memory, and Cognition, 18(5):1084–1102, 1992","venue":null,"work_id":"cb310ace-6121-4481-b143-ab7e77d21c4f","year":1992},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.575727Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:1844ee76261c14da2f89de131ef837671f9b933d87bf12fa8309a6df488e50d9","observation_id":"b7a74f73-af91-4e5a-a488-4b737b1de33d","resolution":{"observed_at":"2026-08-07T10:41:36.589751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.428038Z","title":"Training spatial cognition enhances mathematical learning in a randomized study of 17,000 children.Nature Human Behaviour, 5(11):1548–1554, 2021","venue":null,"work_id":"eabbce74-258f-49a1-928c-bf9380117c2d","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.707476Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:f21411beef46bdae8e69f28717af2d73396fb051d83fc966874de7001b4a8114","observation_id":"e16b8699-13d4-40b7-bbaf-ba831b7559ad","resolution":{"observed_at":"2026-08-07T10:41:36.481915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.272463Z","title":null,"venue":null,"work_id":"470246e2-e97a-4e3b-881d-4073b447dd00","year":2009},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.770571Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:ca81cfe46715dcd15be1d849b717d3bf79afd19112b56745eae97501fb0c49a9","observation_id":"16cbcf72-e795-494c-bb45-d6f90efd16a7","resolution":{"observed_at":"2026-08-07T10:41:36.322632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:21.824598Z","title":"Mechanical reasoning by mental simulation.Trends in Cognitive Sciences, 8(6):280– 285, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.824598Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:0e76a0540212188f96a05afe0995e921bbdbb7d565a6b0d0c4b15e9a4e5a2768","observation_id":"7ab4ad9a-44f0-4339-b57b-967ec4163f50","resolution":{"observed_at":"2026-08-07T10:41:21.824598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:36.090408Z","title":"Johnson, Justin","venue":null,"work_id":"415efaf3-1469-4e9f-9965-9e6c6fa59ce5","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.902807Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:32c46a0c450dbe7183a218c879d7f3a5b5de70015405c56788a8f5ea8a357c5b","observation_id":"9947dae2-1db0-4cbe-9cb3-69068dd8cb74","resolution":{"observed_at":"2026-08-07T10:41:36.167135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.928193Z","title":null,"venue":null,"work_id":"4432b3b7-d997-4a39-ba89-f19252016e61","year":2019},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.948366Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:76604932e6f6ac54c2ef1c2bffb5245634dcafde3e85c550f2171bed564411e8","observation_id":"f0d1917b-42e7-42e1-af76-11d18fb9d67d","resolution":{"observed_at":"2026-08-07T10:41:35.986089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.726478Z","title":null,"venue":null,"work_id":"54c58f00-f225-47e5-8bc8-0ff446ed332c","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:21.989769Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:4ac40218341ef001f250273fae8a84e96482dab84042eeeab6fe87c9ff7fc14e","observation_id":"2f90151b-c29b-49e8-a583-2b5a5a478caf","resolution":{"observed_at":"2026-08-07T10:41:35.816294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.422295Z","title":"Space: A simulator for physical interactions and causal learning in 3d environments","venue":null,"work_id":"89c96e8a-c468-4b6d-8b4f-10f40e5181ca","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.045795Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:00478c631ea7e406325dfe098d19f5070ccd985679e2fc519ce818d13efc9a44","observation_id":"b1df8b67-9f1d-4672-8595-0c32531dd4e3","resolution":{"observed_at":"2026-08-07T10:41:35.562021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-07T10:41:22.119582Z","title":"On the measure of intelligence.arXiv preprint arXiv:1911.01547, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.119582Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b6c20a8a72537be2c88d8f1fecbbeae6a932132aec88bb417910bec3e6eb4328","observation_id":"e583c68e-66cb-4a18-9371-f75ea814b02e","resolution":{"observed_at":"2026-08-07T10:41:22.119582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06468","last_updated":"2025-04-18T03:53:04Z","snapshot_observed_at":"2026-08-12T22:27:42.288453Z","submitted_at":"2024-10-09T01:41:49Z","title":"Does Spatial Cognition Emerge in Frontier Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06468","snapshot_observed_at":"2026-08-07T10:41:22.206726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.206726Z"},"links":{"cited_paper":"/paper/2410.06468","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:6f54774b6d69e9475021676a600608358d6d1bbce0db41e7f47e4a905a7d6cb0","observation_id":"5c065fe2-87e3-400e-9b7f-268312a508bb","resolution":{"observed_at":"2026-08-07T10:41:22.206726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:35.127148Z","title":"Spatial perspective taking: Effects of social, directional, and interactive cues.Memory & cognition, 47:1031–1043, 2019","venue":null,"work_id":"2475413b-0faf-4a4f-bf19-a3ea87e60f0b","year":2019},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.336835Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:07aebc9dc01b59e8fa8faad07cd057118b9ee667ac40564092c54e140de15154","observation_id":"5da8caa2-74c4-4d63-9aef-f68807319458","resolution":{"observed_at":"2026-08-07T10:41:35.259045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:22.447633Z","title":"Shepard and Christine Feng","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.447633Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:40a13f22ea13c0ac34806be70695b3613e9ad46ea3c0c2082bffc04e692e0dca","observation_id":"32d4fd57-1bd4-4b63-94be-886ab500accb","resolution":{"observed_at":"2026-08-07T10:41:22.447633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.837701Z","title":"Identifying cognitive processes and neural substrates of spatial transformation in a mental folding task with cognitive modeling","venue":null,"work_id":"2d0fe85f-3a21-49d5-8bb7-1e3fd4076074","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.506235Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3a580665dfd4b8325d807fb96f8f98144e201ea41d1d7921aff0eb0999ebc905","observation_id":"272fb89b-8626-40c3-a459-36e36b4e9736","resolution":{"observed_at":"2026-08-07T10:41:34.982381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.661357Z","title":"Tangram solved? prefrontal cortex activation analysis during geometric problem solving","venue":null,"work_id":"1f660c6f-48b2-4b28-8ef1-b12444c71eb0","year":2012},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.562607Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:0f5c5acb745978788cbb882aa0587a0c3547d6389e121dc4b2965448ff8705c7","observation_id":"728e303a-4dca-4fd1-8920-a6eae48f7500","resolution":{"observed_at":"2026-08-07T10:41:34.724854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.405234Z","title":"Smith, Elizabeth Bonawitz, and Tomer D","venue":null,"work_id":"e8bb8d9e-be29-49fe-bf01-e93810fd4edd","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.629643Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:adb2c23d6772a5acdd7f849d197418ef5bbcc8a4554d3666cbc17a576b00cc7d","observation_id":"98eed9c3-9a7b-49bd-b0e2-33afe924847c","resolution":{"observed_at":"2026-08-07T10:41:34.524806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.213463Z","title":"Allen, Samuel J","venue":null,"work_id":"eb6c8d5f-5399-4e11-8f1c-932e6ba61c51","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.722765Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:88fb4ac35dc3050261fd701c3575b0d7cea51b95f3d151e5295da5d428cc59b8","observation_id":"137906f4-b475-4eb8-9326-5ad47ca6aa2b","resolution":{"observed_at":"2026-08-07T10:41:34.292203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:34.045024Z","title":"IsoBench: Benchmarking multimodal foundation models on isomorphic representations,","venue":null,"work_id":"dd359712-4b89-4d05-ac7c-a5570b77e7c3","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.866835Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:146b45548e816d2fdd4e13e08d1ed020e0bc318a1f0c350d8367d6db89302023","observation_id":"73aee774-5037-4bf3-adb2-ea12c514ccb3","resolution":{"observed_at":"2026-08-07T10:41:34.129317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.755918Z","title":"Inter- gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"4e3c6955-856e-4d31-a2c1-69b2694cec57","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:22.932633Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:da521e3bce83071184ac96cd7bb8e84e9e1bec4825acd7aab30d58ee998cd244","observation_id":"608d7af6-1083-442a-8b45-04f47c7150df","resolution":{"observed_at":"2026-08-07T10:41:33.867088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.503000Z","title":"Naturalbench: Evaluating vision-language models on natural adversarial samples.European Conference on Computer Vision, 2024","venue":null,"work_id":"fe748ab3-3468-4375-b4d4-fb6584db3b36","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.035740Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:f8e262e5a23a5ade2526f53ea9c41734ad04601009fae81a05dd14fad8e25a0c","observation_id":"cd024bb7-94d0-4865-9987-0348153c6fc5","resolution":{"observed_at":"2026-08-07T10:41:33.598352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-08-13T04:44:21.270903Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-07T10:41:23.165468Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms.arXiv preprint arXiv:2401.06209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.165468Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:01e05d3932f619f6239c36a65a15605cd112f7ba8a194eb10702be29c1a4a549","observation_id":"c4d2c4f5-7971-4722-9fd1-74b1712a1143","resolution":{"observed_at":"2026-08-07T10:41:23.165468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-13T04:55:50.785723Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T10:41:23.231324Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.ArXiv, abs/2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.231324Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b2f91803827a989f3db312e09af07e4c7fe5a96e5df5cf21cd0f43c425e6c464","observation_id":"858d4b93-a6c5-4dbe-9a08-d68c203ae2d6","resolution":{"observed_at":"2026-08-07T10:41:23.231324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-13T05:38:11.293178Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T10:41:23.368760Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.368760Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:153d468a6eebe7b4ad6931f80537018cc86905d54de1c0a7fea5c6dcad4b65c3","observation_id":"0ecb08d9-d824-4b1f-abdb-58bfcb12287a","resolution":{"observed_at":"2026-08-07T10:41:23.368760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:23.464893Z","title":"Kiva: Kid-inspired visual analogies for testing large multimodal models.arXiv preprint arXiv:2407.17773, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.464893Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:0813e6240c138981a2867e60da9366a80d2a4ae6b161f029dc31d9349087c9de","observation_id":"2f356048-f564-4d2b-af18-91a3b81ec9cd","resolution":{"observed_at":"2026-08-07T10:41:23.464893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.264436Z","title":"Stratified rule-aware network for abstract visual reasoning","venue":null,"work_id":"f81071dc-dafb-4706-8b62-10d4a3c39275","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.533862Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:c57ec13fb79cab3f106ad4e775dc2efce53d100b49e1e083a8b072ca535ee30c","observation_id":"7ab2be5d-134c-4f4d-b7c7-0dcf42280bc0","resolution":{"observed_at":"2026-08-07T10:41:33.347493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00264","last_updated":"2025-04-11T21:25:02Z","snapshot_observed_at":"2026-08-12T22:10:05.552997Z","submitted_at":"2024-10-31T23:52:06Z","title":"TurtleBench: A Visual Programming Benchmark in Turtle Geometry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00264","snapshot_observed_at":"2026-08-07T10:41:23.611836Z","title":"Turtlebench: A visual pro- gramming benchmark in turtle geometry.arXiv preprint arXiv:2411.00264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.611836Z"},"links":{"cited_paper":"/paper/2411.00264","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d1725841f4a3e78f0cae5ad851f19f48189b508bfa702fce387e795d71bf95d8","observation_id":"d3b7c65a-97f1-40cf-874c-6901c03898b7","resolution":{"observed_at":"2026-08-07T10:41:23.611836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T10:41:23.680831Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.680831Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:f71950812b74276d81c3ca7b35f5d85a8920218122f04bfe6fdc795a54e3d3cd","observation_id":"0f79e3a9-2926-4dbb-a7b8-f7c5ce3d8331","resolution":{"observed_at":"2026-08-07T10:41:23.680831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:33.028857Z","title":"Matplotlib: Visualization with python.https://matplotlib.org/, 2012","venue":null,"work_id":"23d31e1c-7ead-451a-ae60-e43818d7e7c9","year":2012},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.846590Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:41e8c4b0a73e7b5a669f90aa2e82586c1d8362fe97449564e85f881f9854e62a","observation_id":"74c7ba02-5f4b-417b-bc58-20c3b568562c","resolution":{"observed_at":"2026-08-07T10:41:33.159340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.806024Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"d4d16df5-952b-446d-ad18-8965a69457f4","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.901970Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:97f7b5daf48a574fe90dfc9a3ab43fc351f5ab8ad19051c00bbb96ceb41469e2","observation_id":"cd965a02-8ab3-450d-a21e-5c0d562acc3b","resolution":{"observed_at":"2026-08-07T10:41:32.919995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.511501Z","title":"Blender is free software.https://www.blender.org/","venue":null,"work_id":"30d1981b-c7f3-452a-97c8-e8eaeb42422e","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.963907Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:0c6fb554fd760ea1262f92cc825fe0cccd31dadddb428c20f805452a21e0bb84","observation_id":"f9877b0b-b59d-4196-a61a-f61a68e0ecce","resolution":{"observed_at":"2026-08-07T10:41:32.648660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.257246Z","title":"Objectron: A large scale dataset of object-centric videos in the wild with pose annotations.Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2021","venue":null,"work_id":"91b25ab6-b3cf-4ead-9291-dc2db0e64bb7","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.121793Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:280cff18a1cba09cee3319a247f38deb74aa9d0d769c8bb1492e2a594eea33c1","observation_id":"c19a609b-3691-442e-9c62-ce6501ac2aba","resolution":{"observed_at":"2026-08-07T10:41:32.352822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-13T05:49:42.416742Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-07T10:41:24.193550Z","title":"Habitat-matterport 3d dataset (HM3d): 1000 large-scale 3d environ- ments for embodied AI","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.193550Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b7cba9a5c22d69a7a736e0fb0c5a8d2fe096a7f06fd59c15d44c6a1f3600299d","observation_id":"47a74958-324e-48c0-8dac-bc770a1119da","resolution":{"observed_at":"2026-08-07T10:41:24.193550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:32.008723Z","title":"Habitat: A Platform for Embodied AI Research","venue":null,"work_id":"4d36e38b-2b29-4d96-9ab0-e02ce347d93f","year":2019},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.254352Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:67f5b0763a548da24994bf8863e25acfb5acb2165a6f42c43afdc4df89286ea7","observation_id":"1f4a1073-a72f-40cd-85e1-abc1d38e76c9","resolution":{"observed_at":"2026-08-07T10:41:32.095636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.783712Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"f4992c86-32ce-48f8-bcd0-82927153465b","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.342330Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b29fbd0892891ea7543ac7de8d9e6e0ab6eb6e372fb397ff4e797e13c63c7a75","observation_id":"f6d896dd-9c9d-46e2-a11c-6e7da8eb5341","resolution":{"observed_at":"2026-08-07T10:41:31.880284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.530418Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots, 2023","venue":null,"work_id":"135c0c14-7cdf-4f73-936c-b6c419905385","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.435903Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3274d0c5b0f227ad0ad1125a6b9e7ae76bf067609166e80133ebfc9943cb75be","observation_id":"99575760-05d8-4964-97d8-c36a26e5f764","resolution":{"observed_at":"2026-08-07T10:41:31.650767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.311803Z","title":"Hello gpt-4o.https://openai.com/index/hello-gpt-4o/","venue":null,"work_id":"462bea72-cb55-461f-8801-3bc4ecf3d1e2","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.498308Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:c1472be031cf20a2f5156bf125f07454eb92d993d454f8a36a5213de3a9cec3d","observation_id":"47cd2fbe-f174-44c1-be00-5d79ff6c3c5a","resolution":{"observed_at":"2026-08-07T10:41:31.439938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:31.079843Z","title":"Claude 3.5 sonnet.https://www.anthropic.com/news/claude-3-5-sonnet","venue":null,"work_id":"d137dffb-f92c-44bd-aca1-2ab4e3c7389c","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.556247Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:2d315e44014bc1a333c79a9e86d44ff94336662c75a43916d3ae9a1954aae74a","observation_id":"78305623-c890-4349-b476-f6f84620f118","resolution":{"observed_at":"2026-08-07T10:41:31.136921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.906549Z","title":"Introducing gemini 2.0: our new ai model for the agentic era.https://blog","venue":null,"work_id":"986313a1-ddc2-4933-b898-857bbcd1b3ce","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.620394Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:dd38c1195065f80512c02b3189a1edde9a7a37f935e830a629008ccba321b2fb","observation_id":"238a24c9-fffa-44c4-9a20-bbe2932c9c65","resolution":{"observed_at":"2026-08-07T10:41:30.985638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.723985Z","title":"Gemini 2.0 flash thinking mode.https://ai.google.dev/gemini-api/docs/ thinking-mode,","venue":null,"work_id":"08bb604f-edf1-4034-9d89-d123fedacc7b","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.757815Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:4d99a7d46a8faae57e142c6a761efd721eb449b11c8da254667f225f40aeedbb","observation_id":"190756dc-a3b5-40b1-a9ab-3b76cf6e22b6","resolution":{"observed_at":"2026-08-07T10:41:30.797788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:41:24.806986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.806986Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:b6e55cb0ccca5312e2498072fd26f5f5b210bc35248104df66a597b2a4968193","observation_id":"700a4672-8683-4bf7-8009-fda172910fb3","resolution":{"observed_at":"2026-08-07T10:41:24.806986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T10:41:24.877137Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.877137Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:cd823c191aef0160f5514ca7593ecf118ae6c48b5e7cccde77f30508be851b84","observation_id":"51ba985d-e5f8-4465-bb94-ac09104a5b5d","resolution":{"observed_at":"2026-08-07T10:41:24.877137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:41:24.956325Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:24.956325Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:cb2d857ef2340d5304dbbe6b8c1d2cd4e6fc9864964116f1f91d3774279f872a","observation_id":"f881925d-1a23-4036-822a-89b24315b25b","resolution":{"observed_at":"2026-08-07T10:41:24.956325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T10:41:25.029195Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.029195Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:c21d53ae1dc52780d79f363280316acf1aa99ec55e0149a7da99e98884b3a708","observation_id":"1301a3c2-07f1-4dae-98f7-a35039693bd2","resolution":{"observed_at":"2026-08-07T10:41:25.029195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.503253Z","title":"Structure-mapping: A theoretical framework for analogy.Cognitive Science, 7(2):155– 170, 1983","venue":null,"work_id":"16c19c13-8db2-474a-af5e-fd2bffe09cd6","year":1983},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.113565Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:02ce05d37d4e44aa0f3ca59897eae80c7b22bfa44623fe3d46a917517003c744","observation_id":"cc904712-0516-4acf-9106-242c2791267a","resolution":{"observed_at":"2026-08-07T10:41:30.576846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.312081Z","title":"Carpenter, M.A","venue":null,"work_id":"26f0a0eb-7e41-4347-bdef-28c6fd42dc2e","year":1990},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.164567Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:43e35f0afe50643eab0b774530ffd3b3e1bc7f21231835d102b3aa683394f951","observation_id":"55976ec1-29c8-4560-8a5b-0c0fdcc8dfb4","resolution":{"observed_at":"2026-08-07T10:41:30.414906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:30.159067Z","title":"Lovett and K","venue":null,"work_id":"5e4b29e6-a111-4896-872a-5d422ae019a4","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.256258Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:637341b6657f4588bee07cf3341862cfe7e88179c786249fb9c40e4fc565e08a","observation_id":"de84bb20-eed0-4d11-9cae-dcc2f20c9010","resolution":{"observed_at":"2026-08-07T10:41:30.236791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.991222Z","title":"Holyoak, Alan Yuille, and Hongjing Lu","venue":null,"work_id":"c45705c8-c0f6-469a-ac04-fe909635c5aa","year":2021},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.360747Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:abf27adf2bdedcde3680e116dae9c715e3673a65458fa2528f3e9f29f30fe10d","observation_id":"f055fbe3-4abf-4804-b5ba-9f7518a971eb","resolution":{"observed_at":"2026-08-07T10:41:30.077936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15087","last_updated":"2022-09-29T20:29:26Z","snapshot_observed_at":"2026-08-10T05:12:25.224755Z","submitted_at":"2022-09-29T20:29:26Z","title":"Zero-shot visual reasoning through probabilistic analogical mapping","version":1},"cited_work":{"arxiv_id":"2209.15087","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15087","snapshot_observed_at":"2026-08-07T10:41:27.187348Z","title":"Zero-shot visual reasoning through probabilistic analogical mapping","venue":"cs.CV","work_id":"7c841ec4-debb-4cde-82d9-832f6b639045","year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.418282Z"},"links":{"cited_paper":"/paper/2209.15087","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:94a745f2775e8a5c35dd44fd19a8ab7916253a8863a954e2a81a4cba6b77e5e7","observation_id":"1d0097be-2514-44b6-9f94-3e3387068081","resolution":{"observed_at":"2026-08-07T10:41:27.249937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.821194Z","title":"Ichien, Q","venue":null,"work_id":"304e2b65-47c7-4dfd-8e9d-b99b59867615","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.514932Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:fae1f73b0024695d8e9193f645377888221f3fc6a6e6c357cf627ffda91e092b","observation_id":"c4ee8a0b-c1ed-4f9a-9b18-0a19369a228d","resolution":{"observed_at":"2026-08-07T10:41:29.897215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.625400Z","title":null,"venue":null,"work_id":"90628075-d57a-4727-aae7-f65a7da63d0c","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.555845Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:26bd2a30b6b73367222ecbe3c084fb9ea2401c70316ae421105fa8757346a4ad","observation_id":"33724b69-fa75-4fa2-b992-a47e394f0bc0","resolution":{"observed_at":"2026-08-07T10:41:29.717618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.410156Z","title":"Barsalou","venue":null,"work_id":"87bfde27-24c5-40aa-8bcc-6e7289355091","year":2008},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.686267Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:1b8cfb06c93492cd4b187d9c1566313c0cd24d5ef8b84dad758d74a849e1e07d","observation_id":"2169253e-d8ad-4a4a-8f86-dac3eb855701","resolution":{"observed_at":"2026-08-07T10:41:29.510138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.254753Z","title":"Battaglia, J.B","venue":null,"work_id":"66683460-0056-4213-b3c8-ccfb6058f154","year":2013},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.745416Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3a8ab3b1b6ed532dcf908dedd789e35e9cb3f620597a9acbc0acca842c7b2acf","observation_id":"902ffa29-f1d8-416d-b3d8-6be5d139885d","resolution":{"observed_at":"2026-08-07T10:41:29.332951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:29.065309Z","title":"Tenenbaum, T.L","venue":null,"work_id":"ddfeef30-293f-49db-98c2-3d77f69469bb","year":2006},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.837699Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:637f479c0061886d39750c98f2d4da9dda979aa37e4dd9ab70b27decb105e03a","observation_id":"18f74f4c-9079-4f9b-9ea2-cd0eae9c750e","resolution":{"observed_at":"2026-08-07T10:41:29.148878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.878201Z","title":"Ullman, E.S","venue":null,"work_id":"cd7ec4d3-4790-42de-b46b-f5ea4921b8e4","year":2017},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.912141Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:dc10783b00338e5d6203cc14ed6916c4752df97c27cc6c95e23381739585874a","observation_id":"01a12c99-8406-4aca-a230-6c64c059c027","resolution":{"observed_at":"2026-08-07T10:41:28.975241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.672225Z","title":"Neural prediction errors enable analogical visual reasoning in human standard intelligence tests","venue":null,"work_id":"e9ca446a-4240-405c-8f9a-abdf636c6fea","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:25.987018Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:8d134f3fc99ddf7b648c9b44b74d5b43db02ebe318cee6be12201e2583e7e2e5","observation_id":"0605e0aa-ed6d-418d-8cce-9801eac4b99c","resolution":{"observed_at":"2026-08-07T10:41:28.782655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.520172Z","title":"Piloto, Ari Weinstein, Peter Battaglia, and Matthew Botvinick","venue":null,"work_id":"4a6ced62-2fce-4134-96d1-a9fb1efc5606","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.096545Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:5d6be17b91a65b6ea5cfe5c041d203f36c4044a1714364eb85a8cfb9b06604dd","observation_id":"52be10b7-122e-4afa-883d-2b09bc09c9e5","resolution":{"observed_at":"2026-08-07T10:41:28.579771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-11T12:45:31.157252Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-08-07T10:41:26.158910Z","title":"Bear, Elias Wang, Damian Mrowca, Felix J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.158910Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:d0aadd0d10edea7eacda829481de9a9fa9c482ea3bcddf64d8dd22af87f96a16","observation_id":"acb7d4b5-1705-478c-be8b-542af256c6ee","resolution":{"observed_at":"2026-08-07T10:41:26.158910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.344070Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"1ae5520c-08e3-4c60-a36c-52cdd66b3e76","year":2015},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.294741Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:8925ca6bcdc58633ca38caf292c0fa5220d297099bee31ee28da1d57d73c2036","observation_id":"ab197545-2096-4f0a-98b8-231ae628caa7","resolution":{"observed_at":"2026-08-07T10:41:28.394898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T10:41:26.360267Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.arXiv preprint arXiv:2311.16502, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.360267Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:61528f44ce95bb2fa17654433b1fb3a9a8d0510b4466808a5864952716573c68","observation_id":"7c3e3b65-7e0b-4cb5-b0c5-9f8587c67033","resolution":{"observed_at":"2026-08-07T10:41:26.360267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T10:41:26.394433Z","title":"Wang, Robert Gerbicz, John-Clark Levin, Serguei Popov, Fiona 13 Feng, Steven Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.394433Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:44145e2b6a1ffb6db323714bd782f25102191c8d69f3c64d7838b9c176cb94ad","observation_id":"f0a73e54-397b-46bd-a860-c7eac0958067","resolution":{"observed_at":"2026-08-07T10:41:26.394433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T10:41:26.476410Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark.arXiv preprint arXiv:2409.02813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.476410Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3f2a49b138b9d9e5094262da2f3ffc9dfe969cb5c73ec2c4c4bc73b83b8bd9f7","observation_id":"f2508680-8974-4c03-8c77-d035eea972e6","resolution":{"observed_at":"2026-08-07T10:41:26.476410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.187561Z","title":"Aljunied, Chang Gao, Yew Ken Chia, and Lidong Bing","venue":null,"work_id":"ae198730-ec96-4c68-9dbc-e54af3fd85f0","year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.578960Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:a4842c170c1dbc8b7320161c049c545bb69782f482285071bd6b74f61fba489c","observation_id":"fe53eb07-c3cc-4db5-975a-09d59b22efc1","resolution":{"observed_at":"2026-08-07T10:41:28.270034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T10:41:26.638248Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.638248Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:3d190e6113cf17b137fdcda24db4b37066f80a09083b723f628c00c503231e73","observation_id":"4b90d319-04a4-458d-ad51-00b43c934761","resolution":{"observed_at":"2026-08-07T10:41:26.638248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:28.049975Z","title":"MMBench: Is your multi-modal model an all-around player? InProceedings of the European Conference on Computer Vision (ECCV), 2024","venue":null,"work_id":"9aeed3e6-bb14-4c4d-8b7f-b319a354b528","year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.723845Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:880c351299cd25d47e0ffa1cc398e1f545ae68fd2376e263142400931baa6867","observation_id":"2c880e4f-4445-4f60-ab82-80e29622e449","resolution":{"observed_at":"2026-08-07T10:41:28.090543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03548","last_updated":"2024-12-08T05:18:30Z","snapshot_observed_at":"2026-08-12T19:01:21.687339Z","submitted_at":"2024-12-04T18:45:35Z","title":"Perception Tokens Enhance Visual Reasoning in Multimodal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03548","snapshot_observed_at":"2026-08-07T10:41:26.797359Z","title":"Perception tokens enhance visual reasoning in multimodal language models.arXiv preprint arXiv:2412.03548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.797359Z"},"links":{"cited_paper":"/paper/2412.03548","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:07fd1c2754d14b35f018fde8a589d1d49fbf1557306a69d1e9075f97002f497b","observation_id":"c4bcaab8-ae48-4db9-ab60-0dfbb21133f0","resolution":{"observed_at":"2026-08-07T10:41:26.797359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:27.885097Z","title":"Gon- zalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"621b447a-4451-49e7-8117-578bb36c8368","year":null},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.907731Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:bb676355fc6967cd7953b789a10492fbc60942b6777ea783e0aa20279f3067e0","observation_id":"24c91b08-54a4-4551-a1c7-ffff36c535d7","resolution":{"observed_at":"2026-08-07T10:41:27.980779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:41:27.732590Z","title":"just in time,","venue":null,"work_id":"1a83469d-d486-4caf-af9c-16dfce9884f5","year":2020},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:26.959722Z"},"links":{"citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:cc17fe27cd9cdb69c642a3cf1d9436c4dd0ad83e4e1ec1e566b8435e0255a828","observation_id":"35eaf973-71fa-4837-ae78-edde39f956f5","resolution":{"observed_at":"2026-08-07T10:41:27.839293Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:26:14.524746Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 7 inbound Pith citation observations for arXiv:2506.04633."}