{"as_of":"2026-08-07T19:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88bbc0c758e668e28ba54953a051c183e582d2e270b6e392cbc2c8143ef418d5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":73,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:28:05.321365Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:be9b498a17100a02817011a7282dbd035f09cbec7887e4b9898a770b4cbf1794","observation_id":"f1362d0b-4ad5-4183-9415-315b15b6b608","resolution":{"observed_at":"2026-05-24T01:25:54.470499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-16T08:25:17.847571Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2409.01652"},"observation_digest":"sha256:14b690dd7b6963c7310967ad56ae89bac36c1d56aeb9c5ebfb5405d1d7bc9f27","observation_id":"a86b71ee-5115-4234-9f7b-5b5ec4fca855","resolution":{"observed_at":"2026-05-16T08:25:17.993141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T14:28:05.321365Z","title":"Robopoint: A vision- language model for spatial affordance prediction for robotics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18792","last_updated":"2025-05-24T17:11:32Z","snapshot_observed_at":"2026-08-07T14:23:18.996783Z","submitted_at":"2025-05-24T17:11:32Z","title":"On the Dual-Use Dilemma in Physical Reasoning and Force","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:05.321365Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2505.18792"},"observation_digest":"sha256:09a5de96e5c446e5ec4c92f309e0948d295dc70ca77c9a567fc275a8bfef35c5","observation_id":"e2de53a4-3b18-4735-991b-48d8882f0416","resolution":{"observed_at":"2026-08-07T14:28:05.321365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T13:35:54.956409Z","title":"Robopoint: A vision- language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21652","last_updated":"2025-06-16T19:45:50Z","snapshot_observed_at":"2026-08-07T13:23:27.442216Z","submitted_at":"2025-05-27T18:25:42Z","title":"PartInstruct: Part-level Instruction Following for Fine-grained Robot Manipulation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.956409Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2505.21652"},"observation_digest":"sha256:8aa8d80792063e955152e5e975276890b3cd7d91fc89d4534eb6c2327c413621","observation_id":"8be2bea4-2890-496c-bca7-06d60f75503d","resolution":{"observed_at":"2026-08-07T13:35:54.956409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T10:48:02.636894Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04217","last_updated":"2025-06-21T07:48:50Z","snapshot_observed_at":"2026-08-07T10:43:08.153092Z","submitted_at":"2025-06-04T17:57:44Z","title":"OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:48:02.636894Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.04217"},"observation_digest":"sha256:8242f2fcca5fa9330553ebeb5356c74264f27248629d3eafa986c2a15d842363","observation_id":"effe07d9-5415-4556-af8c-7c6f59977368","resolution":{"observed_at":"2026-08-07T10:48:02.636894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T10:27:30.956653Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05336","last_updated":"2025-07-05T11:38:26Z","snapshot_observed_at":"2026-08-07T10:19:00.643126Z","submitted_at":"2025-06-05T17:59:29Z","title":"VideoMolmo: Spatio-Temporal Grounding Meets Pointing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:30.956653Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.05336"},"observation_digest":"sha256:79811946c2c6073efa37946fe14da482950021add5ca6fa8f707248de1a11298","observation_id":"cd915169-45e4-4cce-b1e1-7e8450643794","resolution":{"observed_at":"2026-08-07T10:27:30.956653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T05:45:56.073790Z","title":"Robopoint: A vision-language model for spatial affordance prediction 14 for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07214","last_updated":"2025-06-08T16:40:40Z","snapshot_observed_at":"2026-08-07T05:51:06.912405Z","submitted_at":"2025-06-08T16:40:40Z","title":"Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:56.073790Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.07214"},"observation_digest":"sha256:64b539032434c9dbf83b604ddf2deebe59560ada95890838eb7cd97e5d669616","observation_id":"27e4b751-6c31-4737-b6b3-7cb5d2275871","resolution":{"observed_at":"2026-08-07T05:45:56.073790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T04:58:54.748524Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09284","last_updated":"2025-08-25T19:45:29Z","snapshot_observed_at":"2026-08-07T04:50:00.649007Z","submitted_at":"2025-06-10T22:47:16Z","title":"UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.748524Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.09284"},"observation_digest":"sha256:04161d5653236203d64b5692cafd4da33d4486026aa3e734d2629c20050d2b4d","observation_id":"d130ec4d-70b9-4aee-89bd-8c518839ea01","resolution":{"observed_at":"2026-08-07T04:58:54.748524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T04:17:12.693223Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10966","last_updated":"2025-06-12T17:59:04Z","snapshot_observed_at":"2026-08-07T13:44:57.666142Z","submitted_at":"2025-06-12T17:59:04Z","title":"GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:12.693223Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.10966"},"observation_digest":"sha256:64bce86328684ddf73ba3e8122007a5949f222be118da118334805abc9540b4f","observation_id":"822ca968-e8f6-4d95-9ddf-8cea73989b70","resolution":{"observed_at":"2026-08-07T04:17:12.693223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-07T04:17:20.434960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11261","last_updated":"2025-06-12T20:04:31Z","snapshot_observed_at":"2026-08-07T12:49:19.052077Z","submitted_at":"2025-06-12T20:04:31Z","title":"Gondola: Grounded Vision Language Planning for Generalizable Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:20.434960Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.11261"},"observation_digest":"sha256:d36db29bb825612bc20585670100ca3b1c83bd9ba1863a3d6913bff013f12494","observation_id":"97df0da4-788d-40b8-96b0-9f6b05992343","resolution":{"observed_at":"2026-08-07T04:17:20.434960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T23:43:16.136090Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16652","last_updated":"2025-06-19T23:42:03Z","snapshot_observed_at":"2026-08-07T02:38:09.664519Z","submitted_at":"2025-06-19T23:42:03Z","title":"CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T23:43:16.136090Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.16652"},"observation_digest":"sha256:6fd4345392b6141acd70af0b11d2e84e55c996a72a809ea3eec3255b1128285d","observation_id":"d2c9f0f7-54d6-4314-9f05-e85f520a24dd","resolution":{"observed_at":"2026-08-06T23:43:16.136090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T21:59:54.651218Z","title":"RoboPoint: A Vision- Language Model for Spatial Affordance Prediction for Robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.651218Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:b5096cbda91da7018b09c12adfe1a043b273a6a2bd96d93c33dd8d1b885ed029","observation_id":"919de7e8-553f-4b0f-a847-4d1c298511a7","resolution":{"observed_at":"2026-08-06T21:59:54.651218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T20:47:31.110057Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-06T20:38:11.691093Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.110057Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:a7cb046a5cacd52459a3372b81f9d3a062067f19cf81c5a2a6d73380d1a3334f","observation_id":"3fd2d4a8-16fb-4e9f-8587-06bfe8fdcf83","resolution":{"observed_at":"2026-08-06T20:47:31.110057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:263f2e4cb8378f58cd8e190e265424129d0f5c4f4f2b8c6c5bf1e6fbbcbab0a6","observation_id":"2920025b-eab7-4974-8b61-b7e3e2db957a","resolution":{"observed_at":"2026-05-16T15:42:41.639539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T15:33:49.890593Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:49.890593Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:60d2c3c0e4dd05bac525c171f87519818eab811f2c204d869f664bec37ad0494","observation_id":"1c2ef52c-cfd3-4b4d-a73a-02f4766f676c","resolution":{"observed_at":"2026-08-06T15:33:49.890593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T03:18:14.655384Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2507.16815"},"observation_digest":"sha256:b800da936327b28e5c86d681744eb8252f83e3a2a9409a732f8b96fde7607168","observation_id":"799b436f-3e57-409b-abd4-28772b3e6b03","resolution":{"observed_at":"2026-05-19T03:22:00.931026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T23:07:31.209664Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05976","last_updated":"2025-08-08T03:23:33Z","snapshot_observed_at":"2026-08-05T23:06:00.795988Z","submitted_at":"2025-08-08T03:23:33Z","title":"PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic Manipulation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T23:07:31.209664Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2508.05976"},"observation_digest":"sha256:0b47bd1b248505b191e4e5f4007b72fdd38dc33aa80674030870ad45ecf59dfe","observation_id":"5a47d01f-2053-4c84-9239-7b43e393ea94","resolution":{"observed_at":"2026-08-05T23:07:31.209664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T21:44:59.524590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08113","last_updated":"2025-08-11T15:53:23Z","snapshot_observed_at":"2026-08-07T18:09:09.035859Z","submitted_at":"2025-08-11T15:53:23Z","title":"AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:44:59.524590Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2508.08113"},"observation_digest":"sha256:2bae64b9c907853d03c598104240446d4f750d07ace49de3d97ea858b7bc18b3","observation_id":"1883ef15-e4ae-4ef4-a52b-c9eb240603b1","resolution":{"observed_at":"2026-08-05T21:44:59.524590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T12:59:12.140493Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-07T18:21:00.618048Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:12.140493Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:1f5d5a2b75131d27dd12751570b5711c1bf6063ff1cd3cd141bfff2e9fdabc33","observation_id":"84fa15c7-d9e8-47b4-a224-0d2076156adc","resolution":{"observed_at":"2026-08-05T12:59:12.140493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T10:37:52.706273Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03893","last_updated":"2025-09-04T05:39:16Z","snapshot_observed_at":"2026-08-07T16:32:01.980381Z","submitted_at":"2025-09-04T05:39:16Z","title":"Weakly-Supervised Learning of Dense Functional Correspondences","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T10:37:52.706273Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2509.03893"},"observation_digest":"sha256:8dec2f7a1269ea7a7664fb435e377d2a062f56babbb8f0986473bbbb14f170a2","observation_id":"edd14926-7aa5-46c8-882f-ee5306c133e8","resolution":{"observed_at":"2026-08-05T10:37:52.706273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-04T23:55:43.219675Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06233","last_updated":"2025-09-07T22:45:06Z","snapshot_observed_at":"2026-08-07T04:14:00.345843Z","submitted_at":"2025-09-07T22:45:06Z","title":"O$^3$Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:43.219675Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2509.06233"},"observation_digest":"sha256:9937f100e548b978d1167f452f387bda9f0c32614313da8fe3d14580309e8ae0","observation_id":"47f571ff-d220-4d07-a286-9e0699cbc58e","resolution":{"observed_at":"2026-08-04T23:55:43.219675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-04T12:54:51.681730Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01642","last_updated":"2026-07-07T04:25:23Z","snapshot_observed_at":"2026-08-04T12:54:45.972724Z","submitted_at":"2025-10-02T03:48:07Z","title":"FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T12:54:51.681730Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2510.01642"},"observation_digest":"sha256:fc9e215a1d0d6acaea50e178926f58a545f614616081072a02f13872b6a82bce","observation_id":"46605936-c719-4104-b1f6-212c958e9f39","resolution":{"observed_at":"2026-08-04T12:54:51.681730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-04T11:38:13.449967Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-07T01:06:23.705525Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.449967Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:3b023f1f41ffb41e61bde5054a19b58b47205c78631ff5e04119f21769f8f842","observation_id":"faddb885-6fc6-4180-a6fc-477c51cb433b","resolution":{"observed_at":"2026-08-04T11:38:13.449967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:f265247d0b7891687c579de996e442fffd13237e4b84a9acf8ce018a3d268d66","observation_id":"c60c20fb-9034-4501-9924-567e7ebe634a","resolution":{"observed_at":"2026-05-14T20:09:40.060801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2511.02239","last_updated":"2026-05-21T21:13:30Z","snapshot_observed_at":"2026-08-01T16:12:14.053996Z","submitted_at":"2025-11-04T04:02:51Z","title":"LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T07:34:55.240907Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2511.02239"},"observation_digest":"sha256:a7d76530b8b4950a97e8b0158316a81264b088064e3ca09fa375ae0d06e1a8d0","observation_id":"e2afd202-39a6-4391-aed0-81760dca456f","resolution":{"observed_at":"2026-05-25T07:35:27.890069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-03T23:08:55.221065Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.ArXiv, abs/2406.10721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-07T07:35:15.256090Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:55.221065Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:dca0a12bd321bd4cbecd4b5e51c34a2a1e68201029d25291e489937a49ad1458","observation_id":"8e378c4c-a10a-4695-a5af-ca05f8850fde","resolution":{"observed_at":"2026-08-03T23:08:55.221065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:f9104f5dfb220e6aa2781dbda9fb07a8c86e2f3bed404f469b46cd8fe6c34736","observation_id":"8ff12f55-fc60-4a0c-b496-23efb6822fd4","resolution":{"observed_at":"2026-05-17T20:42:05.663147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-03T18:42:17.143144Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-03T18:42:08.737584Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:17.143144Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2512.04069"},"observation_digest":"sha256:ea91ada86a453a93bbd1a5a9cccbe1de780e6ec9deb989cd47915412afe13b02","observation_id":"2804e13d-11be-4ea6-8a0c-eacf649fd7f2","resolution":{"observed_at":"2026-08-03T18:42:17.143144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-03T16:27:34.236050Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13660","last_updated":"2026-07-03T09:12:21Z","snapshot_observed_at":"2026-08-07T10:25:19.472041Z","submitted_at":"2025-12-15T18:52:43Z","title":"Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics","version":4},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:34.236050Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2512.13660"},"observation_digest":"sha256:76a79e5ac38892af326c7b8aa7ea0df0c91a379eff913fea2ba02903b296ba79","observation_id":"aa24a293-4403-4269-b033-1a30ab6cf798","resolution":{"observed_at":"2026-08-03T16:27:34.236050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-03T13:29:52.116644Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-06T23:32:01.648397Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:52.116644Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:d5d9308cee51132f9213cd9f35722d9538868ceca7140f9a85b4aeba8dbe576d","observation_id":"9cd5c50c-af50-4cf1-8e1a-614f4bb1962a","resolution":{"observed_at":"2026-08-03T13:29:52.116644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-03T12:30:33.879651Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.879651Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:0eaba7c8503a4d183bc7be611ab7db2073a68b60b69d8264ce60f45ced0c4dfa","observation_id":"391defdb-eab7-48c5-806a-e3101db63784","resolution":{"observed_at":"2026-08-03T12:30:33.879651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:a15b8b423095c5e55df99f517137429da5bba5d27f7363bbfd31ead992991b5a","observation_id":"43e46557-d8fa-4ca2-8f09-9299bcc4f620","resolution":{"observed_at":"2026-05-16T15:08:01.848923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-02T17:15:42.488946Z","title":"arXiv preprint arXiv:2406.10721 (2024) Abbreviated paper title 19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-06T23:11:01.804659Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.488946Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:a163c008bb92cd29df2f71c3ce07a9da306e8c6c366276d7daeb08f77e3aae73","observation_id":"9274b740-af13-46e0-9de9-c52b97d3638b","resolution":{"observed_at":"2026-08-02T17:15:42.488946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-04T05:43:13.314491Z","title":"arXiv preprint arXiv:2406.10721 (2024) Abbreviated paper title 19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-06T23:11:01.804659Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:13.314491Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:a2faee3529bbc2e96a0e43961f2eeccf10760d9fc19a0edb9e50ccf9c6629abb","observation_id":"254beb79-cf5c-45dc-af76-9e0c1b5988d7","resolution":{"observed_at":"2026-08-04T05:43:13.314491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2604.09712","last_updated":"2026-04-08T06:28:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-08T06:28:03Z","title":"LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T19:26:23.660206Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2604.09712"},"observation_digest":"sha256:c95b814443bc4dad838b334dd59de8bf02758bb0bd08b226e8aff1d4afae8272","observation_id":"de868af6-064d-48f7-8e51-4de660d3900e","resolution":{"observed_at":"2026-05-10T23:00:47.718596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2604.10432","last_updated":"2026-05-29T07:09:23Z","snapshot_observed_at":"2026-07-30T10:07:12.774748Z","submitted_at":"2026-04-12T03:09:44Z","title":"AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:41:28.529494Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2604.10432"},"observation_digest":"sha256:164df6f21e6f4098e8e27befe09498928776daabcccde849a7f534c492d19ec1","observation_id":"9e1b85eb-f5c9-4993-a106-14ab9545ac34","resolution":{"observed_at":"2026-05-11T08:21:00.596307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2604.18000","last_updated":"2026-04-20T09:25:30Z","snapshot_observed_at":"2026-08-03T00:50:48.601549Z","submitted_at":"2026-04-20T09:25:30Z","title":"Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T04:27:18.284698Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2604.18000"},"observation_digest":"sha256:b97a01d99b2f7bee7ceafa3641b05f0d81a107596ef1cc0f9fa0b566732374b8","observation_id":"6e8dcd6a-1d33-4205-a770-2014147731f1","resolution":{"observed_at":"2026-05-11T11:56:29.225311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2604.19509","last_updated":"2026-04-21T14:26:29Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:26:29Z","title":"Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:02:16.082857Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2604.19509"},"observation_digest":"sha256:26e545a9f22cb86ecf03d74f4b9d8e879808e536bb7a22d323ca569a356e521c","observation_id":"da05135e-e967-4443-9587-68188f6ea59c","resolution":{"observed_at":"2026-05-11T13:16:16.400879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-07-06T23:07:03.254122Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:b9629ca5337a00a68b38739ddc4b9ba4024fbb0b0c229c5a2b0ad536d642151e","observation_id":"c3db3868-3eeb-4fb3-845e-da793759f331","resolution":{"observed_at":"2026-05-10T00:49:48.855770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2604.27472","last_updated":"2026-04-30T06:14:02Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:14:02Z","title":"PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T08:56:32.164424Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2604.27472"},"observation_digest":"sha256:8a63cc3f02bce74555e57ab277ef58a7fe7494ee6a29afaff95393f9e6475e09","observation_id":"5e866b2c-037e-410b-925d-368ac96618d4","resolution":{"observed_at":"2026-05-12T09:51:29.287485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.02135","last_updated":"2026-05-04T01:31:06Z","snapshot_observed_at":"2026-08-05T04:50:16.338960Z","submitted_at":"2026-05-04T01:31:06Z","title":"Robotic Desk Organization: A Multi-Primitive Approach to Manipulating Heterogeneous Objects via Environmental Constraints","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T18:30:30.675027Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.02135"},"observation_digest":"sha256:cfd96e20ec1c07d1143b05f960509c0f17ea0bd6b70578b3b039abda056b241b","observation_id":"12f7b1f8-18d8-401a-8b25-6097b7f9a629","resolution":{"observed_at":"2026-05-09T06:25:39.411846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.10485","last_updated":"2026-05-11T12:44:26Z","snapshot_observed_at":"2026-08-02T06:15:05.626635Z","submitted_at":"2026-05-11T12:44:26Z","title":"VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T05:09:21.028373Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.10485"},"observation_digest":"sha256:affae67f8a4b531ae9f7969e0264e7ddaf839e81324e4864fee43bc25f1914f9","observation_id":"97c48c6d-4df8-4c1a-86fd-39b946f8bd03","resolution":{"observed_at":"2026-05-12T05:31:26.143646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.12162","last_updated":"2026-05-12T14:13:06Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:13:06Z","title":"X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:07.792757Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.12162"},"observation_digest":"sha256:679c626dcec735605cef55c8019516ae82bfd825023ad127f95e061ca6b0d851","observation_id":"90163eae-dc20-4ea3-8123-6f0d3136c618","resolution":{"observed_at":"2026-05-13T04:52:17.036818Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.14923","last_updated":"2026-05-14T14:58:46Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T14:58:46Z","title":"SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T20:51:56.131205Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.14923"},"observation_digest":"sha256:1c545c5dd5262295e71b5b6ac060c2d63d4bb72b5bd6439f14f10f1679e2c9f0","observation_id":"0fb92b2c-e9b2-4941-86a3-45e559b548f3","resolution":{"observed_at":"2026-06-30T20:55:04.172064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.21133","last_updated":"2026-07-07T18:35:52Z","snapshot_observed_at":"2026-08-03T00:41:31.531422Z","submitted_at":"2026-05-20T13:05:31Z","title":"Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T04:16:15.510851Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.21133"},"observation_digest":"sha256:2d16d621897da685b0b647f20d433c219836f7228182631e23d49bbb23484616","observation_id":"e03f028b-ed1b-44dd-b163-cecab73588cb","resolution":{"observed_at":"2026-05-21T04:19:33.404871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.24203","last_updated":"2026-05-22T20:43:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-22T20:43:47Z","title":"Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T15:36:13.134340Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.24203"},"observation_digest":"sha256:8fe620a2c06417644976782aac94474ff406489f60638ed4519e61ea5ee07ab3","observation_id":"9d8fe995-50e9-4862-8ea5-8197db99b03d","resolution":{"observed_at":"2026-06-30T15:44:48.553382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-02T22:10:19.505273Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:606f7094d72de8c224595c9233945cb7e8c77d547bde8dfed3415e107cebced3","observation_id":"e447a59a-8567-4e38-890b-11f3f06a3558","resolution":{"observed_at":"2026-06-29T21:33:59.010152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:dd03a5aff01397413eb876167de289331e01337876220d15326ac07882596952","observation_id":"16fc1a9d-0a96-405d-833a-d9b5e6981623","resolution":{"observed_at":"2026-06-29T13:43:28.820593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:00.258436Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2605.30877"},"observation_digest":"sha256:fdd193072b9870cad0626d825565cd8bc2101c83ac47c19dcd668ab193334d38","observation_id":"88e654cc-355e-462e-8b12-7f2678198020","resolution":{"observed_at":"2026-07-01T19:26:00.522786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.01247","last_updated":"2026-05-31T14:00:10Z","snapshot_observed_at":"2026-07-06T23:41:48.357871Z","submitted_at":"2026-05-31T14:00:10Z","title":"Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T17:08:59.111306Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.01247"},"observation_digest":"sha256:d31b1f966e872aaf96ce4a165c6a3326303a8c66de2279f42b0649d534afeced","observation_id":"f8729099-9003-4783-9eae-7ff1f06f14fa","resolution":{"observed_at":"2026-06-28T17:12:24.790681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.03240","last_updated":"2026-06-02T07:01:18Z","snapshot_observed_at":"2026-07-31T03:23:10.872093Z","submitted_at":"2026-06-02T07:01:18Z","title":"GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T10:04:10.627420Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.03240"},"observation_digest":"sha256:14ab3186ab9a95c3d4c54a530cf2828c69ce926fda1694e5bf7e389cdd4a5762","observation_id":"ce2fd4cf-eb14-47a6-b0e6-06898011e70d","resolution":{"observed_at":"2026-07-02T03:26:29.221106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.06761","last_updated":"2026-06-04T22:57:34Z","snapshot_observed_at":"2026-08-07T14:49:42.944645Z","submitted_at":"2026-06-04T22:57:34Z","title":"AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T00:47:21.667833Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.06761"},"observation_digest":"sha256:f9c4390f9c16d5e605ece23b212f219e868a1c2f16cbb74502bfc1cadf1b930c","observation_id":"a2989cb6-a0c0-4749-8013-d6925f1b1801","resolution":{"observed_at":"2026-07-02T13:56:59.994289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:7f7bf9d8867e1f088a202b031c7286c645c1cb09868685ae6b1e04ef7bab864d","observation_id":"814a907f-5180-4204-9aa0-d918b211eebe","resolution":{"observed_at":"2026-07-02T22:57:26.625464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:47.754632Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:85d4d9443b6f5c18da4d55b84dc946ac423d6359e231fb494b7f4dc43e26442f","observation_id":"7e2dfe1e-ff0c-453d-802c-5d0b80d94d4b","resolution":{"observed_at":"2026-06-27T13:10:56.935354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:aeac184260b0d8bad18ab9977672a65736ece893c3d1fb2e558654fa2975c1cf","observation_id":"b3fff410-d358-4348-b8e6-ec8766235b83","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.11770","last_updated":"2026-06-10T07:54:42Z","snapshot_observed_at":"2026-07-06T23:50:49.040880Z","submitted_at":"2026-06-10T07:54:42Z","title":"SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T09:59:02.899488Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.11770"},"observation_digest":"sha256:3d64e852b97ac82c4f2f26a644615948c1236ec2a48333dcc84c0bded825215e","observation_id":"1361bfc4-c107-491a-9f80-94ee524203d0","resolution":{"observed_at":"2026-07-03T10:27:56.935424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:21e0e0ec24688603d0b329de9eb796e71813df7e41698578eca5a5b2795d873a","observation_id":"58227ffd-37e0-4898-a3bd-91655f024069","resolution":{"observed_at":"2026-07-03T14:48:32.779436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T11:17:48.279808Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:306c9b1db2fea10f8b0608631adb4144a8a05d31bccb796c2351f43f1acafccb","observation_id":"34ca37b2-dfa9-485e-933e-ebf12aacaae3","resolution":{"observed_at":"2026-06-30T11:24:38.355937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-02T11:20:27.619258Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T11:20:27.619258Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:2c7aa4449df9eabea20c57ebeb5d6ed8de55ec6661d82ecf027caa32c2b38e6c","observation_id":"491565ac-848c-4828-8859-870777043396","resolution":{"observed_at":"2026-08-02T11:20:27.619258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.19340","last_updated":"2026-06-19T13:42:23Z","snapshot_observed_at":"2026-08-02T05:06:10.398443Z","submitted_at":"2026-06-17T17:59:56Z","title":"ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:49:01.269513Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.19340"},"observation_digest":"sha256:ef2906a59b03da8d3dae89c8a9dc668be2369281cbec3965fa00db4b17dfa454","observation_id":"ca5517f8-f184-4605-aa09-f9fb89a051c2","resolution":{"observed_at":"2026-07-04T00:59:20.278059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:c45d7b06c498332a496f2640cc9f319152bd30af8d36730e9985ea72bd44b081","observation_id":"13ac652e-62d1-4a4f-ac54-99b95a57b51c","resolution":{"observed_at":"2026-07-04T04:29:35.142839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.22476","last_updated":"2026-06-21T12:35:43Z","snapshot_observed_at":"2026-07-06T23:57:18.596834Z","submitted_at":"2026-06-21T12:35:43Z","title":"CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T10:54:49.774490Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.22476"},"observation_digest":"sha256:abd7d10beb409c0ccdfc8695868ec3e69f4c139ee38f15558bb187540ec6dfe7","observation_id":"1e56303d-cfbf-4606-852e-e181b9b08c8f","resolution":{"observed_at":"2026-07-04T08:49:42.515654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.26423","last_updated":"2026-06-26T20:07:20Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:25:19Z","title":"CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T01:25:21.796778Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.26423"},"observation_digest":"sha256:640a8dee3eff8689b63510a3d963c5245b471cd2c0ad7c5ea00a3fee5e975ad9","observation_id":"1df1a1d4-2a42-43d7-9246-91b017b79155","resolution":{"observed_at":"2026-07-04T15:49:56.523133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.26423","last_updated":"2026-06-26T20:07:20Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:25:19Z","title":"CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T00:54:50.393828Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.26423"},"observation_digest":"sha256:9ac2e2c6bd43b2eadc6e60ddd418b6d865eefd14eaaf7c3efa0601743851598d","observation_id":"12c2c2d0-9b1c-4ad9-9380-92a2adc8ed2e","resolution":{"observed_at":"2026-07-01T16:05:49.688510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.29089","last_updated":"2026-06-27T21:06:06Z","snapshot_observed_at":"2026-08-04T23:51:33.201822Z","submitted_at":"2026-06-27T21:06:06Z","title":"TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T09:10:55.016700Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.29089"},"observation_digest":"sha256:d36f315b0192e49c53f558b6a1dd2740fb83e7466b645ea874fc9acff0aadce7","observation_id":"c3eeb3aa-87ef-4a5c-bf9a-778eb1f90d17","resolution":{"observed_at":"2026-06-30T13:24:40.641098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.29267","last_updated":"2026-06-28T08:32:35Z","snapshot_observed_at":"2026-08-02T19:16:45.392385Z","submitted_at":"2026-06-28T08:32:35Z","title":"Enhancing Part-Level Point Grounding for Any Open-Source MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T08:06:08.002125Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.29267"},"observation_digest":"sha256:ccef4da39d3c4bc4b62e89123b4a1ca073bf3d6e5b3eef75886cdb27e69c2904","observation_id":"15278caf-c70f-4e39-af8f-f2e00244729b","resolution":{"observed_at":"2026-06-30T08:14:25.843437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2607.00881","last_updated":"2026-07-01T12:45:12Z","snapshot_observed_at":"2026-08-03T01:24:10.985411Z","submitted_at":"2026-07-01T12:45:12Z","title":"OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-02T14:16:39.649823Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2607.00881"},"observation_digest":"sha256:df44736841fc2217b1ae42d31047e1868a48516757134f18e03b63251cfa5fc6","observation_id":"34828b7b-75a3-440e-bbb2-385c40c67ae5","resolution":{"observed_at":"2026-07-02T14:17:02.408465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-07-14T17:30:54.988498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09701","last_updated":"2026-06-21T16:16:02Z","snapshot_observed_at":"2026-08-01T23:36:03.315592Z","submitted_at":"2026-06-21T16:16:02Z","title":"EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T17:30:54.988498Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2607.09701"},"observation_digest":"sha256:506858867ecafa76a5becc09a531f067189a45ed5bc54ef9a3a9db4dc2008656","observation_id":"95305c74-c76c-43a8-b68f-eff34a19beb5","resolution":{"observed_at":"2026-07-14T17:30:54.988498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-07-14T09:52:25.940408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10706","last_updated":"2026-07-12T10:58:06Z","snapshot_observed_at":"2026-08-06T06:06:36.146640Z","submitted_at":"2026-07-12T10:58:06Z","title":"Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T09:52:25.940408Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2607.10706"},"observation_digest":"sha256:c6ab5806afd6185cc278347f73eb2ec3c693c1d3be260b0474c9c502936ae79d","observation_id":"fa6146c2-7270-49b2-a86e-7391c98c9509","resolution":{"observed_at":"2026-07-14T09:52:25.940408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-02T03:16:53.169515Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.169515Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:b6f531dcff655b4130aaf61863c09a15c4b0ad60d5f70a973bee35b5141036b7","observation_id":"58d9205b-0127-4f60-bcdb-574a6b05700a","resolution":{"observed_at":"2026-08-02T03:16:53.169515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-01T14:39:42.590429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:42.590429Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:424803cf4e2a09c0aa7d1763ed95a54a591425072a5134217fb7f575a775ca0e","observation_id":"2accf09d-3eb9-4550-a3da-5f47d33ff0b6","resolution":{"observed_at":"2026-08-01T14:39:42.590429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-04T19:45:35.421540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T09:36:29.490823Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":295,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.421540Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:b0a4b117c9358ef344fa9b20412b98c40c0b3171a71eed5937e078ed53963801","observation_id":"99762039-ea60-47ac-85e5-667f7911b654","resolution":{"observed_at":"2026-08-04T19:45:35.421540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T10:44:18.160988Z","title":"RoboPoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T19:22:25.705009Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.160988Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:f869aebaf3b6a3a2b4a3ec1c26a8bd9e99fc8189b381c15b36be49e8aaa1ab74","observation_id":"c7340192-801b-4d8f-bdc4-a939dbc5ee48","resolution":{"observed_at":"2026-08-06T10:44:18.160988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10721/citation-record","integrity":"/paper/2406.10721/integrity","json":"/paper/2406.10721/citation-record.json","paper":"/paper/2406.10721"},"outbound":[],"paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 73 inbound Pith citation observations for arXiv:2406.10721."}