{"as_of":"2026-08-18T14:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3005ef1f314d06ca277cfb18839cd99470553afa5765a7e9bb3d4f0f690767b","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:22:27.319544Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02978/citation-record","integrity":"/paper/2507.02978/integrity","json":"/paper/2507.02978/citation-record.json","paper":"/paper/2507.02978"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:22:27.058043Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.058043Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:34e55cf6534d449a41b07ca5968f174db31cece5ca0551e31e91303e1105a37c","observation_id":"efa6173f-139b-4196-9fdf-6e94f33c5c4c","resolution":{"observed_at":"2026-08-06T21:22:27.058043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.500569Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"154ce84d-8555-4207-bfe6-e770b46b06c6","year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.063991Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:4efd7233308eb1ced6034c275208a282dd1ea1c28d9db92126e5294557c6452d","observation_id":"f8e2fe0b-7239-441d-a5ec-f4847ee2140b","resolution":{"observed_at":"2026-08-06T21:22:28.504266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T21:22:27.067783Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.067783Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:86df77a9cb85a23122fc2f2221e3bc68af4176fa0bf61cf13ad54a234e05039f","observation_id":"a9d23d11-4bbb-4623-b16b-d4ecaf1365e0","resolution":{"observed_at":"2026-08-06T21:22:27.067783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.071736Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.071736Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:c37e2a5cc8cc3dcd419996e509745bcefb962f94691e11d8ca76956c97b9ee28","observation_id":"80ceecc9-bdd4-4dba-bdd4-56001793092e","resolution":{"observed_at":"2026-08-06T21:22:27.071736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-16T13:49:00.762109Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-06T21:22:27.075271Z","title":"An introduction to vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.075271Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:48e5a74be91f1ec68506abdc920f25bcf69c38d0c7868d12c7a2e2ddc572aae0","observation_id":"5c07af8e-1675-4509-a673-66ff1e0f0776","resolution":{"observed_at":"2026-08-06T21:22:27.075271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-16T13:41:24.654042Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-06T21:22:27.079986Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.079986Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:bda2ae2c23749dfaf4f9962afbce07bcd983912d25e0ff552093384286d805d6","observation_id":"5404da64-bf32-4d31-9561-f7a31b58e557","resolution":{"observed_at":"2026-08-06T21:22:27.079986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.084865Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.084865Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:a704bf5e38f1d78444253321c4fa9cfbb9728231ffeac10e7f6f947fa860f7a6","observation_id":"d5e5d194-63fb-4d32-a2a2-ff5d1737a94d","resolution":{"observed_at":"2026-08-06T21:22:27.084865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-18T10:32:35.062948Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-06T21:22:27.089083Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.089083Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:a21fc3468107b0102fb85d21bb7b350d48454b0bee845bf8f92be57efd490919","observation_id":"ff8c83f7-2708-46ab-b3b5-8589b3cf3601","resolution":{"observed_at":"2026-08-06T21:22:27.089083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:22:27.092879Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.092879Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:33e13dcae958203b79a6001cd5b796c74f369ba1f0a799c9075d5d879cb8bde7","observation_id":"d94cfb30-0923-46e9-94cd-1c62e7cada84","resolution":{"observed_at":"2026-08-06T21:22:27.092879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T21:22:27.097127Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.097127Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:0f50ac1660f2b61f47f8620f7bcd15943806bd34d3847cf70fdeb64316a1a1b8","observation_id":"9b71a8db-4c94-48c2-b200-c1b04c17a942","resolution":{"observed_at":"2026-08-06T21:22:27.097127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T21:22:27.100854Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.100854Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:aa4f99f9e2afa8bcec077846f44339a7a7eedad7a1b6d79397bc00e777acebfa","observation_id":"d62576b9-868f-4cfd-bcf6-47469b123d06","resolution":{"observed_at":"2026-08-06T21:22:27.100854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.477449Z","title":"A survey of spatial deformation from a user-centered perspective","venue":null,"work_id":"1bb9bba1-bb79-4104-a552-abfd3dfe9727","year":2008},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.104700Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:19ac1d467af61ebb79ecc226ec96bde27a79625a2fc8c7ee6065aa32bb443949","observation_id":"efb1efcf-5099-44ae-8adb-d8f170b4c2bc","resolution":{"observed_at":"2026-08-06T21:22:28.481823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04954","last_updated":"2021-12-28T17:03:21Z","snapshot_observed_at":"2026-08-15T19:55:20.506001Z","submitted_at":"2020-07-09T17:33:27Z","title":"ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04954","snapshot_observed_at":"2026-08-06T21:22:27.108384Z","title":"Bear, Dan Gutfreund, David Cox, Antonio Torralba, James J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.108384Z"},"links":{"cited_paper":"/paper/2007.04954","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:a19889e9384d3fd04d83ec18351d113130957afaca57db036a9853eab67ef378","observation_id":"409c138b-0450-4c3e-885a-2933174b9933","resolution":{"observed_at":"2026-08-06T21:22:27.108384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.112478Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.112478Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:bc176f11e5c3babb3f3d2797e8ea764fec262558125e31b12120102e49f90ae2","observation_id":"8f65545d-cf3c-4979-8387-ca562870f27e","resolution":{"observed_at":"2026-08-06T21:22:27.112478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.466235Z","title":"A review on vision-language-based approaches: Challenges and applications","venue":null,"work_id":"f56e0b38-8e5b-4a7d-90d2-5b0ab9cea0a9","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.116332Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:c037833c480fb6971f09378a1027d89158fa495d186f38311b0fd5000ce240d4","observation_id":"03017909-f1b6-4092-94be-673d5a21d1f3","resolution":{"observed_at":"2026-08-06T21:22:28.470848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T21:22:27.120045Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.120045Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:7e0920956c4d5b3f0ab147ab2c91b28e65973481575af7abfb2c77d37c8231f5","observation_id":"ee2df0b5-ed51-4e1a-8ae4-659f11bf2e08","resolution":{"observed_at":"2026-08-06T21:22:27.120045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00193","last_updated":"2025-05-25T18:16:26Z","snapshot_observed_at":"2026-08-16T13:13:57.987401Z","submitted_at":"2024-09-30T19:45:11Z","title":"Do Vision-Language Models Really Understand Visual Language?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00193","snapshot_observed_at":"2026-08-06T21:22:27.125186Z","title":"Do vision-language models really understand visual language? arXiv preprint arXiv:2410.00193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.125186Z"},"links":{"cited_paper":"/paper/2410.00193","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:cf1e1a85556c5f564653efd9443ac67e7e0a8f5a5f7ea568d4d743a633e1906f","observation_id":"a9ba543e-5102-49ad-bd2c-1d24ad5fe75d","resolution":{"observed_at":"2026-08-06T21:22:27.125186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.455764Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":"9c0d8d64-610e-46c8-90c1-80f5907c0511","year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.129486Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:0bcee06153b5ff173a9f91e35236c8b1b33146a4502328728ce2b9f0012786cb","observation_id":"b0c400a5-111d-4c5d-a0d1-1ea5e9a8d56c","resolution":{"observed_at":"2026-08-06T21:22:28.459599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:22:27.133428Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.133428Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:ce1d02c0047e6ea8142704aa72350c544b92f9d2d8ac3a55bf411bf4dd7c2ad2","observation_id":"20b07d36-1b00-48c3-9aec-26ddab86f13d","resolution":{"observed_at":"2026-08-06T21:22:27.133428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-17T08:25:34.071490Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-06T21:22:27.137504Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.137504Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:35a48d16de82ca7f9b28f4b05f2d5644849736eba098a00138eb773f872e4a10","observation_id":"60d45dec-d251-4d99-8eb3-7f73117ffe0e","resolution":{"observed_at":"2026-08-06T21:22:27.137504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-13T18:28:46.913210Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T21:22:27.142055Z","title":"Benchmark evalua- tions, applications, and challenges of large vision language models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.142055Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:d3adefac21011ac91e58cc8ae7e4f3d473e64bf9d8331ea97eede62b82373806","observation_id":"3e98df42-bb97-41ba-b95c-0378bada2da1","resolution":{"observed_at":"2026-08-06T21:22:27.142055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.146793Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.146793Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:490fc117f61bb098b27c1edcdf892b1411e7360008204f096872bdc095996cc6","observation_id":"f01f3633-7072-4b85-9f71-6c86ace0ed7a","resolution":{"observed_at":"2026-08-06T21:22:27.146793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.150631Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.150631Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:36f62b25d0d1da06be4297782938db2fb44d946190f9db8e308b0ba756495491","observation_id":"6db06713-864c-425b-8d5a-4e715b17e033","resolution":{"observed_at":"2026-08-06T21:22:27.150631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.433469Z","title":"MMBench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"9c312413-50c0-4185-a6e0-277375f7c714","year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.154126Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:68fc2af335a962188c696a11eb9163a5a010a25b0c92e0011aa7cad69d1dde28","observation_id":"ed663a21-1fcf-4699-9198-1fb7ed2c9283","resolution":{"observed_at":"2026-08-06T21:22:28.437547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10074","last_updated":"2025-01-23T02:31:25Z","snapshot_observed_at":"2026-08-15T23:57:27.978058Z","submitted_at":"2025-01-17T09:46:27Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10074","snapshot_observed_at":"2026-08-06T21:22:27.158065Z","title":"Spatialcot: Advancing spatial reasoning through coordinate alignment and chain-of-thought for embodied task planning.arXiv preprint arXiv:2501.10074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.158065Z"},"links":{"cited_paper":"/paper/2501.10074","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:76d94b0a44a666baa70a0f3ae7d36704a8cacd018475eb6edc4cc9898c095538","observation_id":"b022d3f3-a60b-435e-99dc-d710ad8ea032","resolution":{"observed_at":"2026-08-06T21:22:27.158065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.162784Z","title":"ivispar– an interactive visual-spatial reasoning benchmark for vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.162784Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:a3ffb132fae5464360ee6d9338289cf266c11d8f84cb1280586ae15e92ea0cb4","observation_id":"0b17bf68-8207-45ea-a02a-1e8ebac30be1","resolution":{"observed_at":"2026-08-06T21:22:27.162784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.423392Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, april 2025, 2025","venue":null,"work_id":"436a7bdf-d82e-47a7-aa19-18a4ad9e0d95","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.167040Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:34530aa44a5724c51a4cd128aa9d0820d367ba8ed5acbe9e8a8e3ca3e9fe53c7","observation_id":"b1c50e5c-6aa7-4b97-80d4-75a0a32c7d70","resolution":{"observed_at":"2026-08-06T21:22:28.427084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.170291Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.170291Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:ef2c4d3774abf3682e77a3d8e6cd5380bc5502f6ddcac54ce9f1d4ab8ab52058","observation_id":"2c93b32b-102c-4fbf-bf44-807c33dd3452","resolution":{"observed_at":"2026-08-06T21:22:27.170291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T21:22:27.173533Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.173533Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:c50ce39ff3d1051ec18837179e0e46969ddfccdafd38ff52208f192ac5216dc3","observation_id":"45177622-4e5b-4019-bb3f-9dade7304a6d","resolution":{"observed_at":"2026-08-06T21:22:27.173533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.177730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.177730Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:065cfac444a5e67c0ba66824d40f3d49e188603301f715c4d828b5b30ddf8a98","observation_id":"f3dfc092-2928-45aa-afe2-847416184d78","resolution":{"observed_at":"2026-08-06T21:22:27.177730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.406927Z","title":"Openai o1 system card","venue":null,"work_id":"e1dc48f8-a05d-4610-a798-d4aff03ac854","year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.181153Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:3fabeb810e3182be5f2d44e6518d14058880657b40d4961e9147a8893d36e364","observation_id":"308b0e76-04f8-4c58-8f74-0d3694bae15d","resolution":{"observed_at":"2026-08-06T21:22:28.410583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.396209Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"48024c4a-c9dc-4b16-8091-0575d38c0888","year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.184457Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:c2d9b6e574035bd29424f24141892aeac9f74a581d9896c956edc814d902d7f7","observation_id":"341101c3-5774-4355-a667-e766f4dc4942","resolution":{"observed_at":"2026-08-06T21:22:28.399797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16632","last_updated":"2025-03-20T18:36:02Z","snapshot_observed_at":"2026-08-16T12:48:09.559922Z","submitted_at":"2025-03-20T18:36:02Z","title":"Benchmarking Visual Language Models on Standardized Visualization Literacy Tests","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16632","snapshot_observed_at":"2026-08-06T21:22:27.188957Z","title":"Benchmarking visual language models on standardized visualization literacy tests","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.188957Z"},"links":{"cited_paper":"/paper/2503.16632","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:1004f05ceff271ce022a26e0989e9dff853ffdae439adf94f2493c083ad2143a","observation_id":"1cf17174-dad2-451b-812f-82a74e9f4b13","resolution":{"observed_at":"2026-08-06T21:22:27.188957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.385054Z","title":"Xiao, Katherine M","venue":null,"work_id":"6f3b0587-9164-4fff-8030-9488f43afba5","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.193467Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:3258bde778ae89d306ca1f12dd85558365c54252df371696671681e03a67d958","observation_id":"d3efb547-31b7-48b7-a085-a4e597a0fa3e","resolution":{"observed_at":"2026-08-06T21:22:28.389127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.372981Z","title":"Does spatial cognition emerge in frontier models? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"2c029b7e-799b-4e87-a4a7-173e4533a4b5","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.197341Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:ec2ff70e7709dd88b10a47b515f417b474539371a33d426936ec515651c723bd","observation_id":"773c1dfd-d541-4fbe-9d6b-31a2b06d175c","resolution":{"observed_at":"2026-08-06T21:22:28.377646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.201575Z","title":"Sat: Spatial aptitude training for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.201575Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:1b90d14aec18bff8c446073f626e140aedeb679f49323de0a4368af19e0774af","observation_id":"88820f74-438f-4f4d-8372-3c3098038c07","resolution":{"observed_at":"2026-08-06T21:22:27.201575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10415","last_updated":"2025-06-07T18:58:44Z","snapshot_observed_at":"2026-08-16T12:41:14.713392Z","submitted_at":"2025-04-14T17:00:13Z","title":"LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10415","snapshot_observed_at":"2026-08-06T21:22:27.205710Z","title":"Doan, and Chandan K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.205710Z"},"links":{"cited_paper":"/paper/2504.10415","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:40db5d59d41e233ea465bdca30f3df58d132720cdd030e3dac5088a09f7fe533","observation_id":"9bfaf9f9-e500-499a-b202-60e3c687bcfd","resolution":{"observed_at":"2026-08-06T21:22:27.205710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"app/1318690","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.787064Z","title":null,"venue":null,"work_id":"73dd3409-113e-4781-8068-8793fc547a24","year":null},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.209478Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:7bd868fbdafb087f39c3c79a09b6cdc40ee26e326c7e1f6a103fade1edc3f85a","observation_id":"ceb77357-89fc-41bd-b727-df9bf3e8403f","resolution":{"observed_at":"2026-08-06T21:22:27.793041Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19990","last_updated":"2025-06-20T05:50:00Z","snapshot_observed_at":"2026-08-16T12:46:52.022609Z","submitted_at":"2025-03-25T18:21:07Z","title":"LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19990","snapshot_observed_at":"2026-08-06T21:22:27.217330Z","title":"Lego-puzzles: How good are mllms at multi-step spatial reasoning? arXiv preprint arXiv:2503.19990, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.217330Z"},"links":{"cited_paper":"/paper/2503.19990","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:d9fad2c2524cb8390c0611496b4b28ab7a790906393aa57b7d93367a8df47763","observation_id":"8cc7a180-207f-4cf7-aef9-4bfdb6afbd0a","resolution":{"observed_at":"2026-08-06T21:22:27.217330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.221010Z","title":"Sparkle: mastering basic spatial capabilities in vi- sion language models elicits generalization to spatial reasoning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.221010Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:65a30d156758f762fdd22065b7d28c6ee668767c47cf1f57fb584e5ce59a0428","observation_id":"4d458bb9-e63c-4a63-abb2-44ea67e31ffa","resolution":{"observed_at":"2026-08-06T21:22:27.221010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.350518Z","title":"Doubao 1.5 pro","venue":null,"work_id":"eea7d4e6-840a-45e2-abd3-7909a5b7f8b4","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.224849Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:171422c716de6b82761e139637dbf55f977415269a4ecdd2a82690b2cb136350","observation_id":"649bd753-a76e-406b-a4bb-aacc8db30441","resolution":{"observed_at":"2026-08-06T21:22:28.354124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T21:22:27.228402Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.228402Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:5ce5505572074937dd507c742ef9b2fa1db6c76c84d2ab9850c33cba6c53b538","observation_id":"a1610a96-cb9c-4269-b3cd-43f4599d33f8","resolution":{"observed_at":"2026-08-06T21:22:27.228402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-16T12:59:16.590181Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-06T21:22:27.232180Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.232180Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:5cfbedab8559dfac345d6ca5905fed0f7050732a18e01cf73c02b41394dcb0ba","observation_id":"523d7cc7-2b37-413f-a10b-177c1b58c87b","resolution":{"observed_at":"2026-08-06T21:22:27.232180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.236386Z","title":"Solving olympiad geometry without human demonstrations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.236386Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:97f9d7a0e04a74076a98d20f67b35521a9b01e4dd18dcf70935772d5eb2ce6a8","observation_id":"8f16d3a3-421d-4a66-ac19-72b27608a049","resolution":{"observed_at":"2026-08-06T21:22:27.236386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.240069Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.240069Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:a485817055f11772cd159681df14312ba8f9edd451dd956353941bfde742a0b9","observation_id":"4440862a-51e9-4abb-b02c-c18cd38b61c7","resolution":{"observed_at":"2026-08-06T21:22:27.240069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.326931Z","title":"Pulsecheck457: A diagnostic benchmark for 6d spatial reasoning of large multimodal models","venue":null,"work_id":"ee599c10-7bed-421b-b820-1d145f281ced","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.243869Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:2c8f887839e00e8c6e009dcce0428ff4d158203e61c3b641117dba880eb2cf65","observation_id":"37194565-8dad-4a2c-9ec1-9323579ae0b4","resolution":{"observed_at":"2026-08-06T21:22:28.331356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.248028Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.248028Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:9e1e96fb7255d0df8003b37f41c3d4112ef178880b4dc62cbe8ff3124bfc4dbc","observation_id":"4e77a2f0-ea24-46ee-9570-4244d13d5132","resolution":{"observed_at":"2026-08-06T21:22:27.248028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.252406Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.252406Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:2c71134271f645fb69da5eafdaea63dc0a39ca48b11fc7a50beba5001114bd0e","observation_id":"a9b32f87-c960-4cbc-97df-33718dfc6ff5","resolution":{"observed_at":"2026-08-06T21:22:27.252406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.255644Z","title":"Boosting multimodal reasoning with mcts-automated structured thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.255644Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:42838bcfdb9af5649e8f6e7d396e076fafbc3527bc88d250ad0fb4e4bd518216","observation_id":"8f098147-c90e-437b-894d-abcfb2aaa693","resolution":{"observed_at":"2026-08-06T21:22:27.255644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.260045Z","title":"Mind’s eye of llms: Visualization-of-thought elicits spatial reasoning in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.260045Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:97edeaf8b2e5a1da776fde8d0c85f6c8c00d3be80217b7484c7450e0a0717f7b","observation_id":"e3ecae9b-2fed-43d9-959b-e8854478b3a8","resolution":{"observed_at":"2026-08-06T21:22:27.260045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.299228Z","title":"Grok 3: Advancing real-time reasoning in ai","venue":null,"work_id":"fad7f7e5-ff61-4fff-9905-09fdf93c99ce","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.264358Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:fa9067ddc2138116f4f72259bd39e36910b4982d838e1a62387637bbf3f32074","observation_id":"064c8468-5102-4cc0-8acc-0ae76c705d63","resolution":{"observed_at":"2026-08-06T21:22:28.302907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.288846Z","title":"Geox: Geometric problem solving through unified formalized vision-language pre-training","venue":null,"work_id":"7cdad0cc-ace3-4263-9d88-7c4c899393a7","year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.268692Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:172f79a7b3e385edfea97adefbf68393207ada0add3efa96fe83c54850d10981","observation_id":"081b7ff8-3589-414b-9cf1-7b52e8e86197","resolution":{"observed_at":"2026-08-06T21:22:28.292361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16234","last_updated":"2024-08-09T03:30:15Z","snapshot_observed_at":"2026-08-16T13:49:28.562191Z","submitted_at":"2024-05-25T13:51:48Z","title":"Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities","version":2},"cited_work":{"arxiv_id":"2405.16234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16234","snapshot_observed_at":"2026-08-06T21:22:27.562733Z","title":"Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities","venue":"cs.CV","work_id":"57efcde3-310c-4248-b48c-e1818f2e3168","year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.272600Z"},"links":{"cited_paper":"/paper/2405.16234","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:0b96da05174fe5c3b4e163b942ebe60ca284c73903e00574cddafa8486e58304","observation_id":"c3ac6562-9041-4516-a706-e2564e4076e0","resolution":{"observed_at":"2026-08-06T21:22:27.568331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-18T11:09:01.459046Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-06T21:22:27.276130Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.276130Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:b4e57a5ede68aac075f2f468a505c7c66d615e521f2f8e6faed5ece03ef711ba","observation_id":"02b7483e-d5ec-4667-a7a2-34060eccddce","resolution":{"observed_at":"2026-08-06T21:22:27.276130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:22:27.280848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.280848Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:07f3e77003f34fbb9913ff667e46fe133cd01b44d09b9074f9276e7ce8d9c84e","observation_id":"5b8e3c95-e72b-41d0-abcb-e4b591be8560","resolution":{"observed_at":"2026-08-06T21:22:27.280848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-14T22:29:28.847917Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T21:22:27.285460Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.285460Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:60f1501faf5f6b6b0dd522f3427ccf686e1b1dd23f91689e28dff6cdc3be647f","observation_id":"382fc582-a65c-4f3c-a54e-10ab15d0e893","resolution":{"observed_at":"2026-08-06T21:22:27.285460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-15T19:40:30.225099Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-06T21:22:27.289983Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.289983Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:9d06034eb0eaa4bb8007a19f8033e1f6614a548276413d60130188ffd886cbc8","observation_id":"2d984caf-423b-429f-a797-ea9f406ecd3e","resolution":{"observed_at":"2026-08-06T21:22:27.289983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.278947Z","title":"Griffiths, Yuan Cao, and Karthik R Narasimhan","venue":null,"work_id":"10afda84-6c58-4c3a-b3c9-8934c0f99ade","year":2023},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.293444Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:092295968e04a981bce186b4dc4d650c15a4b637fe9bd682b177abcb0d591fb7","observation_id":"6ad9d425-d0ef-4861-9350-76ee118678dc","resolution":{"observed_at":"2026-08-06T21:22:28.282350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.297107Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.297107Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:fc15752b69f347840a8aea48cfea53f1e33a01b8dcaa4c13a84856220535eabb","observation_id":"811b8406-018e-4152-a21e-965b3c38747f","resolution":{"observed_at":"2026-08-06T21:22:27.297107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-06T21:22:27.300441Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.300441Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:a644dd49a868a8e442978d8fb1368cf3f50088437b8415cb05ffd95db129e23d","observation_id":"39fed605-86b0-4fc9-a1d1-192143768955","resolution":{"observed_at":"2026-08-06T21:22:27.300441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:27.304216Z","title":"Open3dvqa: A benchmark for comprehensive spatial reasoning with multimodal large language model in open space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.304216Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:b77747acd1c0f62846e3771e109b8b90a88681828bedd45a3563c0f5baf173f1","observation_id":"3bf4f7e7-965c-4ba7-b58c-c5d619de3733","resolution":{"observed_at":"2026-08-06T21:22:27.304216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-16T13:07:19.184083Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T21:22:27.307489Z","title":"–”. Layers are separated by colons. For example, {“Layer 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.307489Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:c4b072bd421ee6623ea8eea3a904fdc096a98836e1a8f30ba2c55fdd33ef7084","observation_id":"53dc4f26-22f7-418d-a351-7d8f26819d2b","resolution":{"observed_at":"2026-08-06T21:22:27.307489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.262771Z","title":null,"venue":null,"work_id":"35143b24-cc1b-4bc8-b1f3-154a9198c4bc","year":null},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.312352Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:2c24c17bb42f732b92496949b75fa9f4b4d71a11554adad12f762d5f766c7d6f","observation_id":"6dcaa078-5d0d-41ce-9976-cd80cef345fa","resolution":{"observed_at":"2026-08-06T21:22:28.266554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.252204Z","title":null,"venue":null,"work_id":"405fa051-80df-4035-ae5d-92de54ff8edd","year":null},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.315929Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:2558ff227bacca5d3a0bde7107ecb07224c173f43fea4f25e9561ffb708576cd","observation_id":"6946ec7f-6327-4654-becb-fe7c8de216f8","resolution":{"observed_at":"2026-08-06T21:22:28.255864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.241804Z","title":null,"venue":null,"work_id":"af5bc142-13b2-4827-8f77-53cde413086c","year":null},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.319544Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:cc07baf6b3a69ece4cec460609dea4992cf54d4e6f511261227fd6bdaf515376","observation_id":"0c6ca4da-04e3-4ebe-8ea7-55ff2c3ccd11","resolution":{"observed_at":"2026-08-06T21:22:28.245245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:22:28.360997Z","title":null,"venue":null,"work_id":"2bd3e6f8-8c56-4e13-8724-e6bea2de26d4","year":2020},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.213883Z"},"links":{"citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:0df22643071310ce47c01a7b9c124127fa6285b398c75256b139a7cc2f4e943a","observation_id":"47a14f60-c09b-4daa-a2d8-0494efa1ba24","resolution":{"observed_at":"2026-08-06T21:22:28.365427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T17:42:59.398099Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2507.02978."}