{"as_of":"2026-08-13T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd7516bf53b7596d941d49b503dd976a9721f6d8c04caea826b67cd9dd9afc8e","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:09.155546Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.19498/citation-record","integrity":"/paper/2506.19498/integrity","json":"/paper/2506.19498/citation-record.json","paper":"/paper/2506.19498"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:12:03.006778Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.006778Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:27e9a4393c8d725c26669726c6fec0fb61b9f81c5b4326ba7035b784d136a8b8","observation_id":"f7dcb54d-4c62-4aef-8593-774b4343b1d4","resolution":{"observed_at":"2026-08-06T23:12:03.006778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-06T23:12:03.047648Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.047648Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5c56c59744c2ff81104f6a9e16a7a373d41d250c25c9374ab359488f5f644d40","observation_id":"21aac602-01f4-46c6-9983-57593bd09a5e","resolution":{"observed_at":"2026-08-06T23:12:03.047648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.743095Z","title":"Copa: General robotic manipulation through spatial constraints of parts with foundation models","venue":null,"work_id":"180f6df9-f3b9-400b-9f3a-1bdddd7f58c8","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.087048Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f1021f36e31f87138c2105cbd06909ce7cbc193ee6523705164ebc3c186f44d5","observation_id":"a8fc755f-0a12-4267-98cd-080e70e43da0","resolution":{"observed_at":"2026-08-06T23:12:12.746596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03841","last_updated":"2025-01-07T14:50:33Z","snapshot_observed_at":"2026-08-12T02:52:50.132814Z","submitted_at":"2025-01-07T14:50:33Z","title":"OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03841","snapshot_observed_at":"2026-08-06T23:12:03.142366Z","title":"Omni- manip: Towards general robotic manipulation via object-centric interaction primitives as spatial constraints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.142366Z"},"links":{"cited_paper":"/paper/2501.03841","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:db4032af64cd0aae2258d6ed90b6edfe190ae8d1e071ebc6b46b4363afb9ca2a","observation_id":"76538e9f-30b3-4326-9c65-c30a45354c5b","resolution":{"observed_at":"2026-08-06T23:12:03.142366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-08-12T12:38:59.448338Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09783","snapshot_observed_at":"2026-08-06T23:12:03.239306Z","title":"Geomanip: Geometric constraints as general interfaces for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.239306Z"},"links":{"cited_paper":"/paper/2501.09783","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ec62d6ac2f2102ba90b4a060b44c4e90f6be9476c8558bf75e2eace1845d30cc","observation_id":"3cf9391e-3c58-41cf-aaeb-7e7b2b496281","resolution":{"observed_at":"2026-08-06T23:12:03.239306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-11T17:12:55.474717Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-06T23:12:03.288372Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.288372Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ab3d43b4813f00fd010a6cbdfa869e73ca5b71c27cfef673bdbe0a51368f81ca","observation_id":"b8cd82c8-14e0-4c5a-9b39-57dd03ce7e62","resolution":{"observed_at":"2026-08-06T23:12:03.288372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-13T01:35:10.442787Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-06T23:12:03.390138Z","title":"Guiding long-horizon task and motion planning with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.390138Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5b49f271b81eea08881e3ab0ed5df6e20f53d024fb57b164bba1a67177aa6b63","observation_id":"976c396b-5b79-49c7-92ee-e309c1a1840f","resolution":{"observed_at":"2026-08-06T23:12:03.390138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.448540Z","title":"Open-world task and mo- tion planning via vision-language model inferred constraints","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.448540Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:204eb970363376ce9a9ce59c73bd92536b837ce13f3d0b41bbf2619b6b301b7b","observation_id":"2760d490-e208-4e5d-ab2d-3edd5e53b8ba","resolution":{"observed_at":"2026-08-06T23:12:03.448540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.567384Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.567384Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a5a5deb360d8e4d0badd6adc7890852c35585bcacb25bdef3917b0195a9a9f2c","observation_id":"11c21ccd-35e1-438d-bb10-5eca6d4f2576","resolution":{"observed_at":"2026-08-06T23:12:03.567384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.613132Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.613132Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:0d08fdfe8b2ed5a48ecea2147364d1658f69b92c74c8278b374177c6afcf7326","observation_id":"dfc156ef-59c4-42dc-bcb1-abd204d73f86","resolution":{"observed_at":"2026-08-06T23:12:03.613132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:03.665705Z","title":"Sofar: Language-grounded orientation bridges spatial reasoning and object manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.665705Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:778f5f408fbadc9d53b51a172d204a88b683ae10f354f4e143d691cff26b5a30","observation_id":"729f7f9d-31dd-4201-8883-8523075fde40","resolution":{"observed_at":"2026-08-06T23:12:03.665705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09829","last_updated":"2024-07-13T09:42:02Z","snapshot_observed_at":"2026-08-12T23:22:55.591980Z","submitted_at":"2024-07-13T09:42:02Z","title":"VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09829","snapshot_observed_at":"2026-08-06T23:12:03.746754Z","title":"Vlmpc: Vision-language model predictive control for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.746754Z"},"links":{"cited_paper":"/paper/2407.09829","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:8c082a86456d566a9a009fb2320c0fd23b7aa6f91b28511176e3741b34555e56","observation_id":"853f45df-a4e2-43cf-b81b-ee8f622a8357","resolution":{"observed_at":"2026-08-06T23:12:03.746754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10546","last_updated":"2025-03-13T16:59:17Z","snapshot_observed_at":"2026-08-07T17:06:27.434649Z","submitted_at":"2025-03-13T16:59:17Z","title":"KUDA: Keypoints to Unify Dynamics Learning and Visual Prompting for Open-Vocabulary Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10546","snapshot_observed_at":"2026-08-06T23:12:03.801070Z","title":"Kuda: Keypoints to unify dynamics learning and visual prompting for open-vocabulary robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.801070Z"},"links":{"cited_paper":"/paper/2503.10546","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5d71f02e2f915cce8f12319640ef1c3b18d32c256ff6eb0c717106f871b1d544","observation_id":"a4dba97b-2dcf-4f91-b96b-a501ea8e86d5","resolution":{"observed_at":"2026-08-06T23:12:03.801070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-06T23:12:03.885154Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.885154Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:90eb4689dc86dccdc398a3a7de230dc6ef25849e69eb62603a72b41f1afa7076","observation_id":"580133e2-e101-42c7-85c3-fa14c6b5f52e","resolution":{"observed_at":"2026-08-06T23:12:03.885154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-08-08T15:04:46.831297Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-06T23:12:03.958565Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.958565Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:cef16b160b61e298fb0ecfd52cf9bce0552446057222323374bab5eab2c9ebd7","observation_id":"995d07c8-f01e-4779-be89-6c9c304d5a5a","resolution":{"observed_at":"2026-08-06T23:12:03.958565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08643","last_updated":"2025-02-18T16:45:59Z","snapshot_observed_at":"2026-08-12T11:17:44.563445Z","submitted_at":"2025-02-12T18:57:22Z","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08643","snapshot_observed_at":"2026-08-06T23:12:03.998541Z","title":"A real-to-sim-to-real approach to robotic manipulation with vlm-generated iterative keypoint rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:03.998541Z"},"links":{"cited_paper":"/paper/2502.08643","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:59ca17d049774006e0673b93529ba288733a44b14d97eb540b569bc20dd24c8a","observation_id":"b1375379-f124-451c-aa10-bf2537dc0f4e","resolution":{"observed_at":"2026-08-06T23:12:03.998541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.726889Z","title":"Learning to interpret natural language commands through human-robot dialog","venue":null,"work_id":"bd90f7f2-a94e-4146-8fd3-7210ecde59f7","year":1923},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.066584Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:793eda8ffede78a8f0ad832860bb442961fb54d9f1d1dc0135780ec185bb6ca0","observation_id":"9dafe183-77f9-43a7-b1fb-f0083b08dbf6","resolution":{"observed_at":"2026-08-06T23:12:12.730699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.715658Z","title":"Grounding verbs of motion in natural language commands to robots","venue":null,"work_id":"119d1b54-7749-4c6c-bcdc-9cb9c3c24e24","year":2014},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.142753Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7d600515d64c3e525032910c7eefb0e06604410e7dc28fdf47255f9ab035d857","observation_id":"aab21090-a360-4a35-9eac-4579e90a30e1","resolution":{"observed_at":"2026-08-06T23:12:12.719822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.706331Z","title":"Toward understanding natural language directions","venue":null,"work_id":"40b6ef36-27d5-4459-9676-d06366f5208d","year":2010},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.190234Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ce7cdeb59597436306a5201031f82b734e0dade0110a54248397c51323c3f4bf","observation_id":"386300ee-6e29-40fe-9074-074470b7b85f","resolution":{"observed_at":"2026-08-06T23:12:12.709353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.696214Z","title":"Understanding natural language commands for robotic navigation and mobile manipulation","venue":null,"work_id":"1cd98053-a336-4b9a-8862-c5d1daa1543b","year":2011},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.271113Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4bfca20796166bcdf78f12361097b7b35730a11145e2f2e1241d78c1bb80c088","observation_id":"c3121184-f8a4-4d0c-b472-90cd1def4285","resolution":{"observed_at":"2026-08-06T23:12:12.699711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-06T23:12:04.326924Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.326924Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:601f1a8b497b190b2e3ac6a739e696311f452255a5ab21f760558954669ada2e","observation_id":"ef9b0120-ba87-41fe-8042-ff94900e6787","resolution":{"observed_at":"2026-08-06T23:12:04.326924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T23:12:04.421149Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.421149Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ef189599d17da6d10f66e98dcbad41c9933252d20531b6a37f3a5b60f5702324","observation_id":"0f291216-b1a5-457e-a4a0-125447ba092c","resolution":{"observed_at":"2026-08-06T23:12:04.421149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-06T23:12:04.499840Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.499840Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:af828ae0d8f3cbf1b85422aa3c53f203ab4b24416eb4e3b1655ee995f1a723d6","observation_id":"eba4b8fc-77ba-492f-91d1-011bb97464b5","resolution":{"observed_at":"2026-08-06T23:12:04.499840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T23:12:04.566817Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.566817Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:04ae950c4b80858be0c97d384816c608de917ca5fe8a1c9ed256ad6981405d21","observation_id":"863da663-d828-452c-a62a-6c80cc8bc02e","resolution":{"observed_at":"2026-08-06T23:12:04.566817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T23:12:04.641939Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.641939Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ca406b78c281567ef5ad61fc588de27694022fe0e26318c9dce4a1a667226909","observation_id":"683d88e5-4fa9-4883-b4cf-83956b5d0b60","resolution":{"observed_at":"2026-08-06T23:12:04.641939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-11T03:40:37.164575Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-06T23:12:04.680233Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.680233Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a2daa8bc6ca652fe3f9805e23c830a9af5931da8913d25f6ffa7e2742792d601","observation_id":"59868033-286d-4dd9-8f01-30a6cca9c25a","resolution":{"observed_at":"2026-08-06T23:12:04.680233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02292","last_updated":"2024-02-07T23:58:10Z","snapshot_observed_at":"2026-08-12T12:46:28.421283Z","submitted_at":"2024-02-07T23:58:10Z","title":"ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02292","snapshot_observed_at":"2026-08-06T23:12:04.770431Z","title":"Aloha 2: An enhanced low-cost hardware for bimanual teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.770431Z"},"links":{"cited_paper":"/paper/2405.02292","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f85337bf7285f77d26acfc400240d67038fceb9e706513c4e2ed21aba997936f","observation_id":"4fccaf42-5f7c-4145-b561-acea518e2579","resolution":{"observed_at":"2026-08-06T23:12:04.770431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-06T23:12:04.843906Z","title":"Mobile aloha: Learning bimanual mobile manipu- lation with low-cost whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.843906Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:fd0f7a67561b421ecd2b07612ba92b95a4a04e14e0dfa8eb40111501e2dec052","observation_id":"173e3d0b-562e-4c94-860b-56bd7c878c87","resolution":{"observed_at":"2026-08-06T23:12:04.843906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-06T23:12:04.884890Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.884890Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f9ae4b47e1c989aabe812941028688f04ebe6305d6c1f9696a43a534ac905007","observation_id":"bac650b5-f260-44c4-a0b8-30472031daa4","resolution":{"observed_at":"2026-08-06T23:12:04.884890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-06T23:12:04.988783Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:04.988783Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:60876ed1785e347544d3b19f6f227450291a140e509a6b0bda122fd4ad7b3e92","observation_id":"1bb37cf4-a892-44fe-9a4d-6c3904cccbdd","resolution":{"observed_at":"2026-08-06T23:12:04.988783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T23:12:05.061262Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.061262Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f7968644ce731ea66f4090dbf72f7e58f21c5b844c03b11490313c489c559211","observation_id":"e9f30bba-37a7-4640-9ca3-92b965550e7e","resolution":{"observed_at":"2026-08-06T23:12:05.061262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T23:12:05.111915Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.111915Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:b32461b73b30a2823be688f6dcfe783af155b0fdb6d2422a813bfa0cc582436e","observation_id":"74e98e85-7c9f-4150-862e-1c6478143aa8","resolution":{"observed_at":"2026-08-06T23:12:05.111915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19510","last_updated":"2025-03-25T10:01:57Z","snapshot_observed_at":"2026-08-07T16:38:50.733709Z","submitted_at":"2025-03-25T10:01:57Z","title":"RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19510","snapshot_observed_at":"2026-08-06T23:12:05.207574Z","title":"Roboflamingo-plus: Fusion of depth and rgb perception with vision-language models for enhanced robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.207574Z"},"links":{"cited_paper":"/paper/2503.19510","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:20e2656e994086183fd120ebb7b25d4f8474b373e39807c25d859891111569f0","observation_id":"6d3f8af4-8d51-4a1a-a2ee-f9d3d15fa295","resolution":{"observed_at":"2026-08-06T23:12:05.207574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-06T23:12:05.276267Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.276267Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:dcf3629cf368489cdbbecafdbaae106ff07993d4b835f2f738311cbb7aace58d","observation_id":"0019b4a4-5b4e-4be1-a351-23cdb4da1fd4","resolution":{"observed_at":"2026-08-06T23:12:05.276267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-06T23:12:05.316266Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.316266Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a4a8b3db2574d925f418bc0699c2035d37aac4856cc01f016403ea937a125f57","observation_id":"431fd637-b19d-4a66-8bf9-2668e5200083","resolution":{"observed_at":"2026-08-06T23:12:05.316266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-06T23:12:05.418519Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.418519Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a0484804004314eb118be4d4e7a32ba47a9c58f4dc4b747febf7cd1a5c65af09","observation_id":"42b8a48b-fb42-4115-9dd3-18e67ce0d8f7","resolution":{"observed_at":"2026-08-06T23:12:05.418519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-06T23:12:05.478000Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.478000Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:52e3a542e5acc94c6db215abc31a05deba9c733437da78fcdde1ba19699377d3","observation_id":"5a081d2e-86fc-45f3-801d-ec30236c942d","resolution":{"observed_at":"2026-08-06T23:12:05.478000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-06T23:12:05.527284Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.527284Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:35f1569bc93f9bb847c0f1caa16f30d4d6fe72251a7021eaf5a56022536e1653","observation_id":"5053b701-0997-4d04-bd89-610c97133537","resolution":{"observed_at":"2026-08-06T23:12:05.527284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-06T23:12:05.638223Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.638223Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:dc08cb85383e47528318a95e89360b887dcf57bd0425294e214ca508691a91c8","observation_id":"792276d5-a035-444e-b92e-4bacef746649","resolution":{"observed_at":"2026-08-06T23:12:05.638223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T23:12:05.690842Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.690842Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d55638c641d603c034b9cc3a82a657e2fd49f9a4dee68c5d386d8313799e324c","observation_id":"9e993ad7-d19a-4958-a9e1-6f1068b6278c","resolution":{"observed_at":"2026-08-06T23:12:05.690842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-06T23:12:05.781091Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.781091Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:205a00e6daafa35c0492457021b8ec0782382f8583699c55da3ab610f5301d4a","observation_id":"5ebc3e1a-ec6a-40e4-8276-dbf108045ac7","resolution":{"observed_at":"2026-08-06T23:12:05.781091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-12T21:21:48.006892Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-06T23:12:05.850037Z","title":"Llm+ p: Empowering large language models with optimal planning proficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.850037Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a068bd2c832297431e49ba23d8827d52db16df63a0a9527d0add14f23cadd8f7","observation_id":"c8e34603-f4c2-4037-8cca-a920b2473925","resolution":{"observed_at":"2026-08-06T23:12:05.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:05.893446Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.893446Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:be94e7d98ce6b95208f85242aef77e4a81263dcf7954e0884000074dec61f620","observation_id":"948a6dba-6d7e-4e96-a0c6-8a10ee1607c8","resolution":{"observed_at":"2026-08-06T23:12:05.893446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:05.953173Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.953173Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:6ca6febb55651557bc4cf2d593429d5a7c7a022af31b3fad60231d7c875d84b6","observation_id":"e3447b32-c4e8-4a2d-b955-4ed8aa480917","resolution":{"observed_at":"2026-08-06T23:12:05.953173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.674128Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"1343ff3b-b4fa-4a1c-9ed6-8b40feb34c29","year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.080619Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:9e4911b75a8ccee125ae7067a644a6bb59fd6e97896e7dbf5a517d2795e093e7","observation_id":"e5024913-6ebf-4446-a471-4ceca1687d6b","resolution":{"observed_at":"2026-08-06T23:12:12.677317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.663503Z","title":"Chatgpt for robotics: Design principles and model abilities","venue":null,"work_id":"2a323430-08e1-4367-a030-abafcb8696e8","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.222417Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f73b1abfb012ec1ce4223ce9237e108fc27cb851b121196c75b866a883db48c1","observation_id":"782b5a8f-d56f-4d43-85d6-09706f9e0715","resolution":{"observed_at":"2026-08-06T23:12:12.667052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08782","last_updated":"2024-10-01T08:54:53Z","snapshot_observed_at":"2026-08-10T12:04:06.796065Z","submitted_at":"2023-12-14T10:02:55Z","title":"Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08782","snapshot_observed_at":"2026-08-06T23:12:06.341930Z","title":"Toward general-purpose robots via foundation models: A survey and meta-analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.341930Z"},"links":{"cited_paper":"/paper/2312.08782","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:f6b151fea6506241fd48448c8fd34e46c261b85ead740545ba5c14771c50da6a","observation_id":"549d0afc-d638-467f-9554-76eafc693ad5","resolution":{"observed_at":"2026-08-06T23:12:06.341930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:06.449159Z","title":"Foundation models defining a new era in vision: a survey and outlook","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.449159Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:53d18da451864cdf627d3aebf3ea9b3cb369a61c2e80028199def9e1b6c7ef03","observation_id":"33ee52c1-a2c9-4f89-9348-2d41e098b838","resolution":{"observed_at":"2026-08-06T23:12:06.449159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.499716Z","title":"Yolov10: Real-time end-to-end object detection","venue":null,"work_id":"36a27194-a980-4630-a475-d33e8a871e87","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.591235Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:2ed080abc5ca3c4df1b76996dadb21a224dab2e2fe1927ef796703c033e6c902","observation_id":"4f3a9ea5-f4d4-4d98-b2e7-3ce1934b8957","resolution":{"observed_at":"2026-08-06T23:12:12.513413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12524","last_updated":"2025-02-18T04:20:14Z","snapshot_observed_at":"2026-07-06T20:38:20.545914Z","submitted_at":"2025-02-18T04:20:14Z","title":"YOLOv12: Attention-Centric Real-Time Object Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12524","snapshot_observed_at":"2026-08-06T23:12:06.730254Z","title":"Yolov12: Attention-centric real-time object detectors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.730254Z"},"links":{"cited_paper":"/paper/2502.12524","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4b0401b091fed71b1e84e51f0e0e9f017c867f01db3f48315b89685cf38d02bb","observation_id":"762187bf-5d7a-4126-8efa-83b428afc9f3","resolution":{"observed_at":"2026-08-06T23:12:06.730254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:06.841797Z","title":"Yoloe: Real-time seeing anything","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.841797Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:4ca6d83e40db8a66beb474e986483e03339174c6570fb1466a3c07632dcf8733","observation_id":"10cdafa9-2d9b-4743-913f-e11df4e5d3cf","resolution":{"observed_at":"2026-08-06T23:12:06.841797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:06.986608Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:06.986608Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:c6d5135f5ca64e325dc341e7ea24c4e5be35a19cad7aa179b859c1ae5c501f2f","observation_id":"06330ba7-25e0-43ef-9875-729e32e584f9","resolution":{"observed_at":"2026-08-06T23:12:06.986608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T23:12:07.109157Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.109157Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:20ae98568e49f6125e53c1a7d0233d6ca95b16afd8571ea802e39e9a8d97248f","observation_id":"cb635328-fa44-4d6b-81b1-06ef8efcb96f","resolution":{"observed_at":"2026-08-06T23:12:07.109157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-12T00:39:28.365579Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-06T23:12:07.220820Z","title":"Fast segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.220820Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:1d581f6db0c20f2f7742cbfa0dbf924c113f78b0e625f1503dadc4dfc80c4609","observation_id":"8b365f20-6304-4397-ab46-0b0f8a3e1c87","resolution":{"observed_at":"2026-08-06T23:12:07.220820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:07.344271Z","title":"Segment everything everywhere all at once","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.344271Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:68d86cf98a158bfab67dce619acf5ef972c56d2ec984f64c0a34b4e1c080e530","observation_id":"e99c5c4b-e05b-42e4-aebb-d10330b70b74","resolution":{"observed_at":"2026-08-06T23:12:07.344271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:12.278451Z","title":"kpam: Keypoint affordances for category-level robotic manipulation","venue":null,"work_id":"d77cfc4c-5a80-41d3-9fb4-0b1f690dda4b","year":2019},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.470139Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:9aec16bb90cf434c717b424d5ff37761dc0b80abe47c56fcdde41fdbab6296ce","observation_id":"96c81ed4-59b5-4a9c-a761-ad09e2dac5ba","resolution":{"observed_at":"2026-08-06T23:12:12.351801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-06T23:12:07.568520Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.568520Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e1902473acd0bf041eade2896906edb90d60e66df4bdc46e45c1351fae098813","observation_id":"c2077bc1-821e-4c72-8444-ed19d164cdc9","resolution":{"observed_at":"2026-08-06T23:12:07.568520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-06T23:12:07.661869Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.661869Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e770f5ab836f5207d3c0d6bef36a0988516e223b847febd9e9234abbc98e0eaa","observation_id":"8da321ad-6616-4dbe-a41e-20a59c43a8cc","resolution":{"observed_at":"2026-08-06T23:12:07.661869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.983256Z","title":"Foundationpose: Unified 6d pose estimation and tracking of novel objects","venue":null,"work_id":"1f6764ed-019c-42ce-8f54-14ee173c3890","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.861016Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5cd4482f0a817abf4b0ca3340c41ad7e33c12f0c87e2c9f598d75d9212a18f27","observation_id":"8b477562-60e4-4212-88fb-6c53e5443b26","resolution":{"observed_at":"2026-08-06T23:12:12.113415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.784352Z","title":"Sam-6d: Segment anything model meets zero-shot 6d object pose estimation","venue":null,"work_id":"7e6c404c-5597-49f6-baa8-4ab44c7c7ec2","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.911112Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a3d6350ae08e5d13df2ab5d92dcfe9af52abac5a8b7288eddc30d64099855f63","observation_id":"ee1f49c4-f2d0-423e-a5db-1332efd13cba","resolution":{"observed_at":"2026-08-06T23:12:11.842969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.594903Z","title":"Omni6dpose: A benchmark and model for universal 6d object pose estimation and tracking","venue":null,"work_id":"ab93f4b3-e0d2-4d01-91cd-3173066e9f9e","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:07.937920Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:537c1eb100d9033fdda4f439e74ed78da3a1ddead7b12f67ec81fcdeca5775c3","observation_id":"a807a592-c2bf-4450-a059-72ad9a73c895","resolution":{"observed_at":"2026-08-06T23:12:11.687810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.379259Z","title":"Gen6d: Generalizable model-free 6-dof object pose estimation from rgb images","venue":null,"work_id":"cab78e7c-80fa-436d-bf68-71b1cd05d05d","year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.021674Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:d5e1446785240c89aec7554bcd079b4f4125a829b43690d1f1cf2a8413361e8e","observation_id":"b6cd504a-d784-4ee8-b767-f44c04bce151","resolution":{"observed_at":"2026-08-06T23:12:11.485692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.176419Z","title":"Onepose: One-shot object pose estimation without cad models","venue":null,"work_id":"7e6d0076-d5a7-443c-842b-191a40b84c3c","year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.096588Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a4b139fc643405d953cab0af977460f72c8c7b1c30ed38964f4aaf173a35f49b","observation_id":"b9fca9de-91cb-4823-9fcd-ca78b24839be","resolution":{"observed_at":"2026-08-06T23:12:11.329092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:11.060712Z","title":"Onepose++: Keypoint-free one-shot object pose estimation without cad models","venue":null,"work_id":"5175e5df-9e20-4f0d-b124-3ac74998eec2","year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.158463Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:c60e68f0f515e9f4b8d242b693ec9eb5927e1eafa958df578bfde0c6f36e0af5","observation_id":"fa9de27d-3787-4f29-a4f2-df1ca297a8f3","resolution":{"observed_at":"2026-08-06T23:12:11.119342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10683","last_updated":"2024-08-14T13:43:28Z","snapshot_observed_at":"2026-08-13T00:53:04.573359Z","submitted_at":"2024-03-15T21:06:14Z","title":"GS-Pose: Generalizable Segmentation-based 6D Object Pose Estimation with 3D Gaussian Splatting","version":2},"cited_work":{"arxiv_id":"2403.10683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.10683","snapshot_observed_at":"2026-08-06T23:12:09.421296Z","title":"GS-Pose: Generalizable Segmentation-based 6D Object Pose Estimation with 3D Gaussian Splatting","venue":"cs.CV","work_id":"cb7b7449-b590-42c7-b99a-28d98e8b7715","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.250575Z"},"links":{"cited_paper":"/paper/2403.10683","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:50149f9af6828ab33c8b0507ec49f317c0a52521a48d7222f0cc88892d72180d","observation_id":"4b407ffb-5d6c-4cca-973e-98c757567aaa","resolution":{"observed_at":"2026-08-06T23:12:09.497856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12716","last_updated":"2022-05-06T14:46:46Z","snapshot_observed_at":"2026-08-09T09:31:23.639168Z","submitted_at":"2022-01-30T03:59:14Z","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12716","snapshot_observed_at":"2026-08-06T23:12:08.280921Z","title":"You only demonstrate once: Category-level manipulation from single visual demonstration.arXiv preprint arXiv:2201.12716, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.280921Z"},"links":{"cited_paper":"/paper/2201.12716","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e97b51adc16732bba1d4e3f62aadcf852c975fda5970a94ba2b4a656aac1c1bc","observation_id":"746ef3ae-d489-4e7a-ba7a-ef9107518ad2","resolution":{"observed_at":"2026-08-06T23:12:08.280921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-12T19:48:48.052898Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-06T23:12:08.358863Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.358863Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e9d0a56540714cc4fad6f0ae988d24f195fc22a804eb121df48fd7b51d2c4a8b","observation_id":"f33928b8-72ce-43a3-a0f8-3f30a67c1475","resolution":{"observed_at":"2026-08-06T23:12:08.358863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-08-12T22:20:39.723856Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-06T23:12:08.430220Z","title":"Vlm- grounder: A vlm agent for zero-shot 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.430220Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:a31bb8fdab965bec3ca37ba218b862a547849e367880f82f4d41a9f40928e297","observation_id":"6b33626f-3e6d-49ac-a012-b6b4d3b5ab12","resolution":{"observed_at":"2026-08-06T23:12:08.430220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10392","last_updated":"2025-03-11T14:42:27Z","snapshot_observed_at":"2026-08-12T20:32:23.765553Z","submitted_at":"2025-02-14T18:59:59Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":"2502.10392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10392","snapshot_observed_at":"2026-08-06T23:12:09.275500Z","title":"TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding","venue":"cs.CV","work_id":"4b6e69df-4be3-4b5e-a0a4-e34c176a96cd","year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.483436Z"},"links":{"cited_paper":"/paper/2502.10392","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:34dde0eb528297b22c090003c160a6aeda4cb72ab321c6e023ac495baf9d69bd","observation_id":"c570fe5d-f911-48a9-acee-dc952887e705","resolution":{"observed_at":"2026-08-06T23:12:09.345486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.861917Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"2f76d241-9df1-4c1d-b34b-d191bf46f335","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.570568Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:7f3e70f58ecd0c6281cb8e91872810a533891cd43df35d692d1d1ba2da84c498","observation_id":"c5c84f78-1d05-4bdc-b997-dee6732cd87f","resolution":{"observed_at":"2026-08-06T23:12:10.982349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T23:12:08.608592Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.608592Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:216d8743f397a0a8949ef4a40ff7ef1e2a29de0a408a9d1d3ebe4e7462d547ae","observation_id":"52372e6f-62d9-47c3-ba65-9551ac4a6178","resolution":{"observed_at":"2026-08-06T23:12:08.608592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T23:12:08.686757Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.686757Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:aff0b8f4b75db7721dbdfbcd696c31d91b7b491a3c5f26ac30ed5c6d778de16a","observation_id":"3ce2b293-2739-4dba-8e62-d862d532f07d","resolution":{"observed_at":"2026-08-06T23:12:08.686757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04689","last_updated":"2025-01-08T18:52:03Z","snapshot_observed_at":"2026-08-12T18:10:02.095752Z","submitted_at":"2025-01-08T18:52:03Z","title":"SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04689","snapshot_observed_at":"2026-08-06T23:12:08.750059Z","title":"Spar3d: Stable point-aware reconstruction of 3d objects from single images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.750059Z"},"links":{"cited_paper":"/paper/2501.04689","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:dd7cf0dbf3cfb5d578c54abaa1b6d0d8ee5d3f1440c34827367f19dfbf19e12b","observation_id":"0a6daf92-271e-4862-b982-7d1c9c3cc231","resolution":{"observed_at":"2026-08-06T23:12:08.750059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.738862Z","title":"9dtact: A compact vision-based tactile sensor for accurate 3d shape reconstruction and generalizable 6d force estimation","venue":null,"work_id":"2abd3df6-afce-4e5e-8161-ca108e9bc31d","year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.827515Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:5754c5c4adefefa5e4bff0e73787d59e749b4fa2c9b47f58c33d5cc787c57ad7","observation_id":"53ca0041-7873-444e-ac7f-7068092a9c50","resolution":{"observed_at":"2026-08-06T23:12:10.785173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06211","last_updated":"2022-02-13T05:14:22Z","snapshot_observed_at":"2026-08-10T21:11:37.867025Z","submitted_at":"2022-02-13T05:14:22Z","title":"Tac3D: A Novel Vision-based Tactile Sensor for Measuring Forces Distribution and Estimating Friction Coefficient Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06211","snapshot_observed_at":"2026-08-06T23:12:08.914602Z","title":"Tac3d: A novel vision-based tactile sensor for measuring forces distribution and estimating friction coefficient distribution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.914602Z"},"links":{"cited_paper":"/paper/2202.06211","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:13e8d78d844fdd8f796ab8957f0bb853acb31ae7a0c176a3ce45e9fc921daa27","observation_id":"76c4b5a8-b5b9-4cfe-99ab-e89056c77a1d","resolution":{"observed_at":"2026-08-06T23:12:08.914602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.581244Z","title":"Pointodyssey: A large-scale synthetic dataset for long-term point tracking","venue":null,"work_id":"b5713dad-c9a6-44ea-a257-d3cdd1823f51","year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:08.982750Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:ff7464d2583e654aa8a13c2eeea9be5ad116ac17d7ebc5fd86aeda6f7c7614b9","observation_id":"daadb4f5-6f63-488a-acb5-81076bc53dda","resolution":{"observed_at":"2026-08-06T23:12:10.666620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:09.050283Z","title":"Cotracker: It is better to track together","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:09.050283Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:045eae22090c9d7a251a7e8c6cfd15376512ff8f2bb0177155f728c0dffa69c8","observation_id":"191d4ab0-115c-4010-960f-05535a61a749","resolution":{"observed_at":"2026-08-06T23:12:09.050283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.431123Z","title":"Robotap: Tracking arbitrary points for few-shot visual imitation","venue":null,"work_id":"5637e281-bf63-4bc5-9347-0e22422d3739","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:09.075532Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:e0c87db90b65bb1d5634f090e69309b3d7adcdf6585c8d0085ce9fbb24c2aa68","observation_id":"ae492222-1f9a-42d4-81cf-495c70edff99","resolution":{"observed_at":"2026-08-06T23:12:10.496351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:10.292289Z","title":"Recyclable","venue":null,"work_id":"cb1a6fb8-51c8-46c6-8b93-2a63780bfb30","year":2024},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:09.155546Z"},"links":{"citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:13514bd9b7c8ef94d2aa4a7d612a04e34a85bdbe7f057640a120b3fff5277e94","observation_id":"83a67dae-83d4-4528-88d5-e146ac0b2397","resolution":{"observed_at":"2026-08-06T23:12:10.345022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2506.19498."}