{"as_of":"2026-08-09T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78b5c3f8e5db3a7dad0052d9bbb6c051a09a58dc960b68e4cc36ec5043bfba82","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:24:04.777438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T23:09:34.805552Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2501.07542"},"observation_digest":"sha256:3f5210c1399ef40610f21ff4a0d33684818243405126da0d03dcd0b935c7ec41","observation_id":"db059a5a-634b-4ba9-aff2-7ec41000d777","resolution":{"observed_at":"2026-05-16T23:09:34.859572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T14:24:04.777438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19015","last_updated":"2025-08-08T09:55:18Z","snapshot_observed_at":"2026-08-07T15:04:36.637684Z","submitted_at":"2025-05-25T07:37:34Z","title":"Can Multimodal Large Language Models Understand Spatial Relations?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:24:04.777438Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.19015"},"observation_digest":"sha256:953084cbe4a52f633959061a2c513121e0dfd3795de6a85ad7d7c31c467975a2","observation_id":"6ee4ee5c-9a39-4345-90d7-00518300fbf6","resolution":{"observed_at":"2026-08-07T14:24:04.777438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T12:38:39.933165Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24139","last_updated":"2025-06-03T17:03:22Z","snapshot_observed_at":"2026-08-09T05:05:14.167129Z","submitted_at":"2025-05-30T02:20:14Z","title":"S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.933165Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.24139"},"observation_digest":"sha256:ff9f07a87c4b56eacd8b6d9f0d4baf2050f593a0754624ad372fa357e53ea7fa","observation_id":"6c1db7ac-7239-46d4-a0be-41b8f3b2a0d3","resolution":{"observed_at":"2026-08-07T12:38:39.933165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T12:21:20.914495Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models.arXiv preprint arXiv:2406.01584, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-09T05:59:14.538896Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.914495Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:aa5ae53a4a9898ea69020f52214c35f8157f973d6245a9052db270bdea280eb1","observation_id":"eaf3a9d2-5463-4376-a6bc-5326c43abcfe","resolution":{"observed_at":"2026-08-07T12:21:20.914495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T10:35:44.249542Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.249542Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3e1665826b54e082d627c4d4181cc0ef5839f57b09bd62e745fdbd23d284dede","observation_id":"61d2f55d-3e29-4091-92b3-383a5c5938ae","resolution":{"observed_at":"2026-08-07T10:35:44.249542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T00:57:27.127004Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models.arXiv preprint arXiv:2406.01584, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-07T07:38:26.007252Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:27.127004Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:c19f959a9046a215105cdafc26530194f9b5e13c171eead3471ec023525b845f","observation_id":"e85307f9-bf8d-42ae-aaf8-e44fdc65d69a","resolution":{"observed_at":"2026-08-07T00:57:27.127004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T00:25:05.011646Z","title":"Cheng, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14233","last_updated":"2025-06-17T06:46:15Z","snapshot_observed_at":"2026-08-08T12:41:42.352203Z","submitted_at":"2025-06-17T06:46:15Z","title":"Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:05.011646Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.14233"},"observation_digest":"sha256:ab548829fc346d9d146fc91520bb095a8420c011673936a880a00c9161daf0bf","observation_id":"9f89895c-f4bf-432a-8c13-6e42b8eabd64","resolution":{"observed_at":"2026-08-07T00:25:05.011646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T00:13:29.384793Z","title":"Cheng, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14763","last_updated":"2025-06-17T17:57:37Z","snapshot_observed_at":"2026-08-07T04:22:17.875129Z","submitted_at":"2025-06-17T17:57:37Z","title":"RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:29.384793Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.14763"},"observation_digest":"sha256:9ca5989527dc139c0523a8a99081748f295166ca1a5b9c4cc8b6cccbca3ec972","observation_id":"91e0ac93-8634-4490-81b6-3162bc71aa63","resolution":{"observed_at":"2026-08-07T00:13:29.384793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T23:12:12.750753Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19469","last_updated":"2025-06-24T09:53:10Z","snapshot_observed_at":"2026-08-09T06:05:37.126560Z","submitted_at":"2025-06-24T09:53:10Z","title":"Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:12.750753Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.19469"},"observation_digest":"sha256:03ad145405c2c8bdba14f82ec31fb0a29edea7e7ddbeb605685d721c7017b73a","observation_id":"1cb6f7bd-1dfe-4715-881b-fbe525c78b9a","resolution":{"observed_at":"2026-08-06T23:12:12.750753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T21:52:20.579394Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23219","last_updated":"2025-06-29T13:04:27Z","snapshot_observed_at":"2026-08-09T04:14:50.291653Z","submitted_at":"2025-06-29T13:04:27Z","title":"UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:20.579394Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.23219"},"observation_digest":"sha256:07c4542f72af06e35780658dcf20258949c296ab44f0e9d25e5ca186e1f01ac4","observation_id":"ca1bd479-40fe-484f-a892-1beea35e5999","resolution":{"observed_at":"2026-08-06T21:52:20.579394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T21:22:27.097127Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-08T00:06:19.287707Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.097127Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:baea0d784db316fd1c6420de6f1bd643ba2868a80b0de53d325d5f1a300a1177","observation_id":"9b71a8db-4c94-48c2-b200-c1b04c17a942","resolution":{"observed_at":"2026-08-06T21:22:27.097127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T19:56:14.629466Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04293","last_updated":"2025-07-06T08:35:22Z","snapshot_observed_at":"2026-08-06T19:48:54.522958Z","submitted_at":"2025-07-06T08:35:22Z","title":"AutoLayout: Closed-Loop Layout Synthesis via Slow-Fast Collaborative Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:56:14.629466Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.04293"},"observation_digest":"sha256:8eb6be3d7587267526c071c611f6f5279f32d64d2212a06e343c5d78b5f8b4a6","observation_id":"eff6343f-b388-4618-810d-b99b1296daa9","resolution":{"observed_at":"2026-08-06T19:56:14.629466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T19:09:25.638480Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-07T09:17:00.032323Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:25.638480Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:58acad5e4a880cb8ecbacf841333bc5200597d767079a6b0fdbbc8aa6b90ed47","observation_id":"aa4cd893-691c-4236-96ff-78c5eb4d968e","resolution":{"observed_at":"2026-08-06T19:09:25.638480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T18:24:50.450996Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.450996Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6120a97b4ba51a1240466b012a87b43952a7c380ff80b855e0f090d428f5b42d","observation_id":"a214032c-b48a-448e-b668-586e250128f4","resolution":{"observed_at":"2026-08-06T18:24:50.450996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T15:14:16.913232Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16524","last_updated":"2025-07-22T12:32:35Z","snapshot_observed_at":"2026-08-08T23:17:09.833524Z","submitted_at":"2025-07-22T12:32:35Z","title":"Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:16.913232Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.16524"},"observation_digest":"sha256:0a0f50a3b5636f287f286a6b8b0196dff799a15bb6bd030e3643be714e9ae108","observation_id":"6cabf21b-16b5-4f30-849a-44cecbdfbe34","resolution":{"observed_at":"2026-08-06T15:14:16.913232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-03T11:31:47.613184Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T22:04:34.235731Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2508.13998"},"observation_digest":"sha256:4fc2e91ecec31c67b966c34f5dd04c29744fd211d1c67cca3ae0df471a1d0403","observation_id":"49e5a4d9-4f94-4b70-b6f5-839031e9bc6e","resolution":{"observed_at":"2026-05-18T22:06:51.724391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T11:56:08.100667Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02175","last_updated":"2025-09-04T16:38:44Z","snapshot_observed_at":"2026-08-05T11:56:06.572610Z","submitted_at":"2025-09-02T10:32:58Z","title":"Understanding Space Is Rocket Science -- Only Top Reasoning Models Can Solve Spatial Understanding Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:08.100667Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2509.02175"},"observation_digest":"sha256:abe69294024a9527c9ed152b8862c82bc1cae4dfcc4cecfd50fae4551858cd9f","observation_id":"fbbdb503-c116-4f08-9fb4-c62944dd3a0b","resolution":{"observed_at":"2026-08-05T11:56:08.100667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2511.02627","last_updated":"2026-06-11T15:36:40Z","snapshot_observed_at":"2026-08-08T22:40:29.987506Z","submitted_at":"2025-11-04T14:57:11Z","title":"DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T01:18:44.523602Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2511.02627"},"observation_digest":"sha256:dd69c9dd67537773d0749d9392a31d0aabfd5413ce5d532513659df37f439615","observation_id":"d9cb7737-9013-4111-b31c-9d0ec45dee76","resolution":{"observed_at":"2026-05-18T01:20:34.446572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-04T00:11:50.465239Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.02627","last_updated":"2026-06-11T15:36:40Z","snapshot_observed_at":"2026-08-08T22:40:29.987506Z","submitted_at":"2025-11-04T14:57:11Z","title":"DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T00:11:50.465239Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2511.02627"},"observation_digest":"sha256:83a64c3740fde8a29ef378e4659f3fd1009e1dd0ff47bb6eb121d0f10d855f50","observation_id":"185a0f71-71f6-47b5-b1c0-81a63a0152c0","resolution":{"observed_at":"2026-08-04T00:11:50.465239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-03T21:41:28.734178Z","title":"Spatialrgpt: Grounded spatial reasoning in vision–language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14271","last_updated":"2026-06-26T09:18:22Z","snapshot_observed_at":"2026-08-03T21:41:27.751052Z","submitted_at":"2025-11-18T09:05:26Z","title":"Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:41:28.734178Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2511.14271"},"observation_digest":"sha256:3dfad09941205a12e0c16b686fe11659c2c602c425ebe3c79a931edd589af917","observation_id":"c11b4357-5a09-4755-be09-f9b025ac2240","resolution":{"observed_at":"2026-08-03T21:41:28.734178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2601.22228","last_updated":"2026-04-29T18:36:35Z","snapshot_observed_at":"2026-07-06T22:43:35.226546Z","submitted_at":"2026-01-29T19:01:03Z","title":"Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T09:31:39.548562Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2601.22228"},"observation_digest":"sha256:52bc1a23cd6193ce3c4a2703e001647e544ea1db834a848d2cf6567419702c4c","observation_id":"58ef9cc4-cba5-4ace-bfdc-b6888ef921e0","resolution":{"observed_at":"2026-05-16T09:32:41.261611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-03T03:25:12.110307Z","title":"org/CorpusID:267069344","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08236","last_updated":"2026-05-31T23:44:59Z","snapshot_observed_at":"2026-08-03T03:25:11.411186Z","submitted_at":"2026-02-09T03:21:48Z","title":"When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:25:12.110307Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2602.08236"},"observation_digest":"sha256:9d9147afbcf32a6c518f22a870ea09f76151d39ce927f1a3d73c4507c0c3a7b4","observation_id":"a763a5cf-2318-4778-b72d-9a76454f1ad9","resolution":{"observed_at":"2026-08-03T03:25:12.110307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2603.08096","last_updated":"2026-04-20T17:13:59Z","snapshot_observed_at":"2026-07-06T22:48:21.803560Z","submitted_at":"2026-03-09T08:37:05Z","title":"TrianguLang: Geometry-Aware Semantic Consensus for Pose-Free 3D Localization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T15:12:23.459579Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2603.08096"},"observation_digest":"sha256:b94f4e66b52e8f580d3b0fca2bd99645d2da5e3199f212dea591918d0e371f34","observation_id":"aac82ce6-25c0-4e8d-b671-7897e406c611","resolution":{"observed_at":"2026-05-15T15:16:09.802485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2604.03660","last_updated":"2026-04-04T09:26:09Z","snapshot_observed_at":"2026-07-06T22:52:48.277339Z","submitted_at":"2026-04-04T09:26:09Z","title":"TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T17:20:28.036531Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2604.03660"},"observation_digest":"sha256:d44e913f7aebf785d015e09f4b4b45f610928d7dd718f283bf65e90e60be8534","observation_id":"9a45f726-1e72-4ffd-bf4c-fc25f0c75fab","resolution":{"observed_at":"2026-05-13T17:23:02.419126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2604.07592","last_updated":"2026-04-08T20:49:50Z","snapshot_observed_at":"2026-07-06T22:55:46.307881Z","submitted_at":"2026-04-08T20:49:50Z","title":"Spatio-Temporal Grounding of Large Language Models from Perception Streams","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:10:45.837684Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2604.07592"},"observation_digest":"sha256:245595c6f23860d50573cf2e32d0359e7323f609e8dc360e5c5812582dee31f7","observation_id":"f57c5c60-8de1-43ac-a63d-0d3b49227210","resolution":{"observed_at":"2026-05-11T07:26:02.689307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2605.18621","last_updated":"2026-05-18T16:31:31Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:31:31Z","title":"CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:37:27.926364Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2605.18621"},"observation_digest":"sha256:b69bc9b6123013f80023c6433995f1455cb22acfe3715213e8602806e7fee1dc","observation_id":"886c959b-7470-4a40-af9b-df541b56054b","resolution":{"observed_at":"2026-05-20T10:38:12.293094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:22.778489Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:e75e12db0efe4a1a8055f78708218e424c7bcff7c6a7b4b12748ac4a1257f361","observation_id":"ead79631-e448-4237-9af1-29b412302b17","resolution":{"observed_at":"2026-05-20T10:53:13.215752Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:25:17.831116Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2605.18746"},"observation_digest":"sha256:a6fd7245aca0717c7001b6e614e1c87f1f4463a625e3c2c897ea2ec716cc1f28","observation_id":"6f538434-ae76-48b7-8472-071c30261078","resolution":{"observed_at":"2026-07-01T15:05:47.188163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2605.20448","last_updated":"2026-06-18T10:11:04Z","snapshot_observed_at":"2026-07-31T21:41:31.719093Z","submitted_at":"2026-05-19T20:01:19Z","title":"Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T06:55:04.657347Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2605.20448"},"observation_digest":"sha256:3c38a42960bf6716d48e09f17435c2350a31d6f7b9903bdc134323f32be62094","observation_id":"a3a9c864-aa3e-4fbc-9b2e-78d242c02496","resolution":{"observed_at":"2026-05-21T06:59:45.735753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2605.20448","last_updated":"2026-06-18T10:11:04Z","snapshot_observed_at":"2026-07-31T21:41:31.719093Z","submitted_at":"2026-05-19T20:01:19Z","title":"Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T17:52:26.785086Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2605.20448"},"observation_digest":"sha256:26ad1726c6edbdaefed067e6c0039ef2c3781ff2effff542ae7744094ec88a8c","observation_id":"7e319e28-7db0-4b32-a131-154b894762ed","resolution":{"observed_at":"2026-06-30T17:54:57.801081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2605.30557","last_updated":"2026-05-28T20:44:47Z","snapshot_observed_at":"2026-08-03T01:31:13.605258Z","submitted_at":"2026-05-28T20:44:47Z","title":"Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:48:19.295578Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2605.30557"},"observation_digest":"sha256:66f0246d12fde16e53fd44f7da06857586f17b7fb583f4395b9ef3f9eb4933af","observation_id":"72c8c96f-3697-4353-bab3-fce7fbdce1e8","resolution":{"observed_at":"2026-06-29T07:53:13.548789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2606.02842","last_updated":"2026-06-01T20:06:50Z","snapshot_observed_at":"2026-08-02T06:55:51.435821Z","submitted_at":"2026-06-01T20:06:50Z","title":"Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:40:05.730181Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2606.02842"},"observation_digest":"sha256:f8e8cc5ef190d0a25dc961a723890d12da3d8b6c9bd8805e64bda4a2cf3abc66","observation_id":"6c6e2dfe-20c2-49cd-a532-764928834525","resolution":{"observed_at":"2026-07-01T22:16:15.673197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2606.05677","last_updated":"2026-06-04T04:00:12Z","snapshot_observed_at":"2026-08-02T16:24:06.015782Z","submitted_at":"2026-06-04T04:00:12Z","title":"LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T02:16:25.730555Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2606.05677"},"observation_digest":"sha256:94f0d91842381561b8bf8a1ba5fb1c68b9f61d3ee74cc9ed210f74ce82d27974","observation_id":"80dead48-e9dc-418f-9f8d-49be12347821","resolution":{"observed_at":"2026-07-02T12:16:57.256251Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:65b11ecf86d0211e9e6d068b64191c4fc60d7a15572619f5115bb6a507ff1f1c","observation_id":"d2bd64cf-6304-4103-8a82-22c262e82591","resolution":{"observed_at":"2026-07-02T17:37:14.468135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2606.17539","last_updated":"2026-06-16T05:32:39Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:32:39Z","title":"Reinforcing Dual-Path Reasoning in Spatial Vision Language Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-27T01:42:30.005911Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2606.17539"},"observation_digest":"sha256:9f3a6060bb94d9aea21acbccb3c98731701a434783ed021582a2ecd2bfdf3d66","observation_id":"b9b16f0b-1593-4c89-b43d-c9450caed3c8","resolution":{"observed_at":"2026-07-03T20:08:55.590121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2606.22219","last_updated":"2026-06-20T20:41:43Z","snapshot_observed_at":"2026-08-08T21:42:34.105257Z","submitted_at":"2026-06-20T20:41:43Z","title":"Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T10:37:24.946718Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2606.22219"},"observation_digest":"sha256:b533dd2bc12438d4dba5cef6dabba8abffeeb4541cfef2da6e9599b859a5387e","observation_id":"b8566166-c3ac-4e6a-b48d-b1de1d6526c3","resolution":{"observed_at":"2026-06-26T10:39:18.313055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":"2406.01584","doi":"10.48550/arxiv.2406.01584","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialRGPT: Grounded spatial reasoning in vision-language models","venue":"arXiv (Cornell University)","work_id":"cece8f93-8aed-46f8-a36b-261804d5acb3","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:dbec659258df0140966d4d9fba3cc7625044ff2b162c12cab17652574fd39ed3","observation_id":"93afacff-302a-46a6-a0f7-3e0e5f9b8d17","resolution":{"observed_at":"2026-07-04T15:09:55.087107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-02T06:36:27.565496Z","title":"Cheng, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-06T22:26:58.903585Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.565496Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:bbba65cac81f696b36816d6a41b035183e7309b9231946ec053ffcb981fb0b60","observation_id":"d5f799bb-513d-43f3-aa90-2c83bb44d230","resolution":{"observed_at":"2026-08-02T06:36:27.565496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.01584/citation-record","integrity":"/paper/2406.01584/integrity","json":"/paper/2406.01584/citation-record.json","paper":"/paper/2406.01584"},"outbound":[],"paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2406.01584."}