{"as_of":"2026-08-15T01:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7472f180e6d04f88d1a8b88f649d742ee7ee512aa4372610645d659d9219091","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:33:58.479385Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T03:06:43.700595Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-11T19:51:43.385412Z","title":"Spatialvlm: Endowing vision-language mod- els with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06322","last_updated":"2024-12-09T09:18:32Z","snapshot_observed_at":"2026-08-11T19:44:29.498862Z","submitted_at":"2024-12-09T09:18:32Z","title":"LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:51:43.385412Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2412.06322"},"observation_digest":"sha256:0776afd71cb8bec176f995fe3ce7b7c8835862150869db707d309147a6565c4a","observation_id":"48438ee1-5f7e-4dd8-b156-f1dc65cc05a8","resolution":{"observed_at":"2026-08-11T19:51:43.385412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-10T17:26:35.470855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-13T05:19:41.022471Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.470855Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:4d1a9d13c91722f64dd24774039bfc2b8b008aa8e1a31f2ee828c8d35448ffba","observation_id":"98641f75-569f-4748-b8a6-73654f86fa24","resolution":{"observed_at":"2026-08-10T17:26:35.470855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-09T11:50:03.189919Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-13T22:41:46.187040Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T11:50:03.189919Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2502.02562"},"observation_digest":"sha256:72102e5d344a684cb160375a01048434bac315cf27d12f712d53e4ae44bbf9f5","observation_id":"a45179ff-a548-46c8-bfcc-2f6311b025a4","resolution":{"observed_at":"2026-08-09T11:50:03.189919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-07T12:36:20.778339Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.778339Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:1fd890b78abab79f24ca967c066474685cdf2e61f33a20ab71416049284871a8","observation_id":"ecee111c-99a8-4f8e-82a8-7493c4edd222","resolution":{"observed_at":"2026-08-07T12:36:20.778339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-07T06:04:11.687427Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.687427Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:c155c32538b76ecdc1cacc5c5304843698e629990dbdfbb45d9200fb4c7c7407","observation_id":"a82e9a24-ed16-4b9a-a427-25cd479fe798","resolution":{"observed_at":"2026-08-07T06:04:11.687427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T21:48:51.657856Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:51.657856Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:dceb53ef5ec94ca21658f7e02d015b214bc566610244ea6e5d00d58dd2687a87","observation_id":"e1d998d1-f294-4f63-905f-d4b06ff9f1f6","resolution":{"observed_at":"2026-08-06T21:48:51.657856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T19:54:48.162766Z","title":"Spatialvlm: Endowing vision- language models with spatial reasoning capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-14T19:11:09.144427Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.162766Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:df76f9cf8696f2dff3f7dbd2ce891e543a6db6a2706bc056b7664f80019d36c8","observation_id":"e7f85b5b-2a86-40c6-b069-8646390f3e0c","resolution":{"observed_at":"2026-08-06T19:54:48.162766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T15:03:27.082032Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17012","last_updated":"2026-06-10T06:47:08Z","snapshot_observed_at":"2026-08-08T07:48:44.526710Z","submitted_at":"2025-07-22T20:49:25Z","title":"Sustainability assessment using multimodal AI agents","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:03:27.082032Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2507.17012"},"observation_digest":"sha256:c7c03c1112737ecf3511871a0b86b6af8316e0bf87fad9ce3b0fb5fd0943cc54","observation_id":"d56ca6d2-3da4-48fc-83ca-1c00617ec8ad","resolution":{"observed_at":"2026-08-06T15:03:27.082032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-05T11:56:07.947697Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-13T23:46:54.580924Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:07.947697Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:3141dc5116923bd693cbe1b0bacd2a1536ff07e4bb41e108f42c418359bf7dc5","observation_id":"033b7dc6-1001-45df-ae01-844f0722ad04","resolution":{"observed_at":"2026-08-05T11:56:07.947697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2603.08096","last_updated":"2026-04-20T17:13:59Z","snapshot_observed_at":"2026-07-06T22:48:21.803560Z","submitted_at":"2026-03-09T08:37:05Z","title":"TrianguLang: Geometry-Aware Semantic Consensus for Pose-Free 3D Localization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:12:23.459579Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2603.08096"},"observation_digest":"sha256:3239a43e0dc52a1f77caf049d2abf7e44d343f3d15d346ec912ce002adead608","observation_id":"6e0d4a50-0c88-4a17-9bce-c82ec548426a","resolution":{"observed_at":"2026-05-15T15:16:09.680303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-14T18:54:01.033350Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:d522ff5f029daef391b168438f3f1bd50a405bfd758ff74f291e439e67baf6ac","observation_id":"dc63545e-e5f0-43f7-a984-90ee3e098ed3","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-08-11T12:52:26.203109Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:3064c0a80ca32b40712a962a5b2c89d960477a9a90db533b42a8fbcbf498ba93","observation_id":"1f806e86-4c61-4cc9-b2f2-229ee754e391","resolution":{"observed_at":"2026-05-13T23:13:24.784848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-08-11T06:12:30.304597Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:7dc7d0c5caf37307479addb41fddcf8b9fd70b4f2e98b72ce4269bb3ad8d32dd","observation_id":"4042bd62-411d-4827-a6a5-d300abfe0de5","resolution":{"observed_at":"2026-05-10T00:49:48.849225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2604.25954","last_updated":"2026-04-25T14:19:29Z","snapshot_observed_at":"2026-08-11T12:45:59.872264Z","submitted_at":"2026-04-25T14:19:29Z","title":"Fast Core Identification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T07:11:30.553696Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2604.25954"},"observation_digest":"sha256:43bd0e85827401d805b231e384bb4bed7f937f1bcd90391399a9ce1c14643975","observation_id":"8115d2dd-7059-40e7-ae26-f6c89343a181","resolution":{"observed_at":"2026-05-11T21:01:14.738363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2605.01694","last_updated":"2026-05-03T03:19:42Z","snapshot_observed_at":"2026-08-14T20:59:13.844240Z","submitted_at":"2026-05-03T03:19:42Z","title":"Latent State Design for World Models under Sufficiency Constraints","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:31.825583Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2605.01694"},"observation_digest":"sha256:3488345344422990474667d847582db93ec38148b367670a18f8b357b5aa7cb7","observation_id":"33c744aa-d26f-4a17-a6a6-16932b24b563","resolution":{"observed_at":"2026-05-11T09:36:04.461629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-08-11T16:40:12.299909Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T20:40:59.877854Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:676e66a406d7fcf928b427fd1f296a047ba24733c5d1a5e6446448e8b5b551bf","observation_id":"69da90aa-aaa9-48f4-b247-5247b855e41d","resolution":{"observed_at":"2026-05-14T20:42:57.776205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2605.13169","last_updated":"2026-05-15T16:50:42Z","snapshot_observed_at":"2026-08-11T16:40:12.299909Z","submitted_at":"2026-05-13T08:31:22Z","title":"PanoWorld: Towards Spatial Supersensing in 360$^\\circ$ Panorama World","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T16:57:03.172340Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2605.13169"},"observation_digest":"sha256:6fde6b292a685f707535f3bbd5b565aa6673f6178eb9864fdc9a20abbb3761a1","observation_id":"23a5b44b-64c5-49ad-be51-9ce0c3695052","resolution":{"observed_at":"2026-05-19T16:57:40.149820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.00963","last_updated":"2026-05-31T02:36:57Z","snapshot_observed_at":"2026-08-12T21:36:08.386386Z","submitted_at":"2026-05-31T02:36:57Z","title":"Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:46:21.821764Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.00963"},"observation_digest":"sha256:622b47b17a9e8b37eabf4fa6cab9dc2c2383399192897b2fbd9807c68e1c16c5","observation_id":"b696d70e-7b11-4944-861a-72ea37bed505","resolution":{"observed_at":"2026-07-01T20:46:13.715412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.03240","last_updated":"2026-06-02T07:01:18Z","snapshot_observed_at":"2026-07-31T03:23:10.872093Z","submitted_at":"2026-06-02T07:01:18Z","title":"GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:04:10.627420Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.03240"},"observation_digest":"sha256:61ddc7be5e4d0f609b8fadb416273010c1d939cec2ba845f270b2a6ceaf99f59","observation_id":"8b054447-c513-4c7b-96e8-94c20819320c","resolution":{"observed_at":"2026-07-02T03:26:29.202939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:648495504fd71b9a9553e4e6f65c393e0f06c3d154fe474d2de87eeca4c3d297","observation_id":"c1ccb55f-fade-44c5-a941-4f5298ab4061","resolution":{"observed_at":"2026-07-02T02:36:27.141917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.05677","last_updated":"2026-06-04T04:00:12Z","snapshot_observed_at":"2026-08-13T16:51:39.502297Z","submitted_at":"2026-06-04T04:00:12Z","title":"LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T02:16:25.730555Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.05677"},"observation_digest":"sha256:5a6112af01cf7309dc3fa4a7ee4ac87630bd0b41b95ec60f4012fc76252eb736","observation_id":"19c5ae1c-b4f1-42ca-830b-a59f7df338e2","resolution":{"observed_at":"2026-07-02T12:16:57.214345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.05833","last_updated":"2026-06-18T15:40:37Z","snapshot_observed_at":"2026-08-03T07:19:30.958860Z","submitted_at":"2026-06-04T08:11:12Z","title":"Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:13:53.219095Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.05833"},"observation_digest":"sha256:d3f7ac82a33fbe796017a01d42a1db566972d25226f2909bf1e46f715a121e34","observation_id":"63d4cc74-765a-4972-8a29-1c166fdb8eb9","resolution":{"observed_at":"2026-07-02T12:16:57.509150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.17539","last_updated":"2026-06-16T05:32:39Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:32:39Z","title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-27T01:42:30.005911Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.17539"},"observation_digest":"sha256:1a94e093735b7cef8165e42978dcbbf826d8efa109922cfed4ce5864981063ff","observation_id":"e2c309cb-eb6c-44c3-bca1-bf0e98e3f9da","resolution":{"observed_at":"2026-07-03T20:08:55.661477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.23565","last_updated":"2026-06-22T16:31:48Z","snapshot_observed_at":"2026-08-08T12:22:46.578257Z","submitted_at":"2026-06-22T16:31:48Z","title":"HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:27:15.889885Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.23565"},"observation_digest":"sha256:b08aa69683bdb6b7956dcab520aa1d3bbb9151363460602c4c69893e9ab62603","observation_id":"71a61b51-b882-40bd-952c-b3fcc22ebe5f","resolution":{"observed_at":"2026-07-04T10:49:46.492839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2606.31200","last_updated":"2026-06-30T06:30:22Z","snapshot_observed_at":"2026-08-07T12:04:48.584226Z","submitted_at":"2026-06-30T06:30:22Z","title":"Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:01:37.880943Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2606.31200"},"observation_digest":"sha256:789719a91780cf9fef25d82c93d8c722d04e8959addcc6bdd1d32248042ddd73","observation_id":"abacc9ee-aef9-4d82-8fd3-78487bc291c6","resolution":{"observed_at":"2026-07-01T09:55:41.219848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2401.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-10T03:06:43.700595Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":"cs.CV","work_id":"dd74ba70-5068-4b69-ba35-988d213c87bb","year":2024},"citing_paper":{"arxiv_id":"2607.08724","last_updated":"2026-07-09T17:30:49Z","snapshot_observed_at":"2026-08-05T03:35:49.427704Z","submitted_at":"2026-07-09T17:30:49Z","title":"Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T02:59:21.353359Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2607.08724"},"observation_digest":"sha256:48d2ee10cedb7d50c74d275f12c83cbaf96dc7cd46c2a29bf9fb554a2cc80975","observation_id":"6861a3c7-0b02-429d-b5b7-34abebf4b381","resolution":{"observed_at":"2026-07-10T03:06:43.701881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-31T07:19:14.164642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24707","last_updated":"2026-07-27T17:46:43Z","snapshot_observed_at":"2026-08-04T19:59:12.791082Z","submitted_at":"2026-07-27T17:46:43Z","title":"ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T07:19:14.164642Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2607.24707"},"observation_digest":"sha256:13e63976f154865f118d127cc8b23f8c3293b7c9ef7eec943a4eac7b675bf916","observation_id":"e5a2891b-07d2-407c-b3a2-24b431e394d9","resolution":{"observed_at":"2026-07-31T07:19:14.164642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T18:44:50.379910Z","title":"arXiv preprint arXiv:2401.12168 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04698","last_updated":"2026-08-05T11:07:22Z","snapshot_observed_at":"2026-08-14T20:44:53.282372Z","submitted_at":"2026-08-05T11:07:22Z","title":"Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:50.379910Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2608.04698"},"observation_digest":"sha256:bc2a4ad614120aa643c4b9aad01c9554f060bdb29f9672ed49e72e46b034f7f5","observation_id":"c5f835b9-a579-4434-bb92-bb0e2de903a8","resolution":{"observed_at":"2026-08-06T18:44:50.379910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-12T00:33:58.479385Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities.arXiv preprint arXiv:2401.12168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08053","last_updated":"2026-08-08T10:39:09Z","snapshot_observed_at":"2026-08-13T23:47:50.270782Z","submitted_at":"2026-08-08T10:39:09Z","title":"PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:58.479385Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2608.08053"},"observation_digest":"sha256:38760416d65e8a7e625b662a3fa03e691c13d014718d14cd194623274ccb62b1","observation_id":"703e5350-68a9-4d22-a1c6-6143e6ef89bf","resolution":{"observed_at":"2026-08-12T00:33:58.479385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.12168/citation-record","integrity":"/paper/2401.12168/integrity","json":"/paper/2401.12168/citation-record.json","paper":"/paper/2401.12168"},"outbound":[],"paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:37:33.333367Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2401.12168."}