{"as_of":"2026-08-20T10:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4beace813b63c77f1e0b11e339d6bbeeb3219aefb56113143e31330ea6ffcd2e","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:36:31.872581Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.12356/citation-record","integrity":"/paper/2607.12356/integrity","json":"/paper/2607.12356/citation-record.json","paper":"/paper/2607.12356"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T06:36:23.166024Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.166024Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:4aefff37ff6efedde0d70297b67106fd726391595d185defb2d316c3a7a5dbcb","observation_id":"e2cc636e-79cd-4e8c-a7a0-0f5b5833992a","resolution":{"observed_at":"2026-08-02T06:36:23.166024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T06:36:23.280797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.280797Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:96657744c3d92be3845693349cf73fddef1e39bb44c46fb39decabcffed6ab93","observation_id":"25e6fef5-64ea-4e4f-8ec9-81d127aa2ad3","resolution":{"observed_at":"2026-08-02T06:36:23.280797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T06:36:23.367916Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.367916Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:2f7d90010d9b6ec7b7008d607cf8a8dacaa47b757e40a7fe60dbba20ec0f8c9d","observation_id":"7ebe897a-ee55-45d0-8bb3-b45616df8916","resolution":{"observed_at":"2026-08-02T06:36:23.367916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:23.488544Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.488544Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:a0bb3b6703b64e1231e7c55057a12816133425471fdb8d26ef05327090026c22","observation_id":"b84bd19d-e94b-4b12-9b24-b6f3ca2029a2","resolution":{"observed_at":"2026-08-02T06:36:23.488544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T06:36:23.578152Z","title":"Black, N","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.578152Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:8e44d9779feb1fbbe14e5473c7e830071bd3b5e65fe45933d87dcf6e38efca0c","observation_id":"35feefd8-44ba-4ed9-938b-f6b6ccd50616","resolution":{"observed_at":"2026-08-02T06:36:23.578152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T06:36:23.645708Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.645708Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:73281b9f4e278daa187bcc6497b6aeecc2849bfaeab10a1030f4e424677f00eb","observation_id":"97a31604-e061-46bb-843d-e00e41ec1987","resolution":{"observed_at":"2026-08-02T06:36:23.645708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:23.780023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.780023Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:1ce0c2fa99a6c75dd27d2507535958c7ef38bcc730056ca9566f8ab4650d69ca","observation_id":"11371d50-90dd-4657-ae7b-d16a00cd3f80","resolution":{"observed_at":"2026-08-02T06:36:23.780023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:23.835029Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.835029Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:01c30e13359e445cc985ef51565b2ce2a1f1c107859bcdd85e067adc20a5fa56","observation_id":"db037f6f-3351-4bd8-82f3-b0b378e7e852","resolution":{"observed_at":"2026-08-02T06:36:23.835029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T06:36:23.909984Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:23.909984Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:b451b1dc67c8a57f9e66f2885e39982f4b809c197ed5208fee61813943393192","observation_id":"64c10c29-b70f-4c16-af7d-e91281758fdd","resolution":{"observed_at":"2026-08-02T06:36:23.909984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:24.026772Z","title":"Bhat, Y .-H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.026772Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:640bf86b114d8148fa23d4b5fbf70e5681101b0cbd06fbf6508836ab0ae9a017","observation_id":"ebbafc21-243d-4ce0-8597-7399b63c714d","resolution":{"observed_at":"2026-08-02T06:36:24.026772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-15T23:50:04.432268Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14836","snapshot_observed_at":"2026-08-02T06:36:24.155591Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.155591Z"},"links":{"cited_paper":"/paper/2510.14836","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:c78a0f80f588e3ca060379ea48a9b3dc4b42b8a6a674f1225667e3cd7d76b6d9","observation_id":"a1d0db6f-42ae-4aeb-9dd0-ab8e68f11c00","resolution":{"observed_at":"2026-08-02T06:36:24.155591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-20T05:57:34.826209Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T06:36:24.227962Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.227962Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:0efc11a8c2ad8019bf4d58216cafaf6566ad2481ea07379e664641f8f4cd4b81","observation_id":"fe2c3af0-27e8-43b5-84d5-86693374356a","resolution":{"observed_at":"2026-08-02T06:36:24.227962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-17T09:51:16.654214Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-02T06:36:24.361775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.361775Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:e14b2099c937b5414f8b4e1ad26107448171d55d0a4bccefb8a4f20c897ad3cf","observation_id":"4e0972ee-631b-49a8-b983-2cc8cdd6ba3f","resolution":{"observed_at":"2026-08-02T06:36:24.361775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:24.434386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.434386Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:b5df35ab7259e594f5ee95dc4e674a9c8c44da69d3c74966f54afa035039440e","observation_id":"d9d0d3be-a7c6-480f-83f0-9eb675e2c759","resolution":{"observed_at":"2026-08-02T06:36:24.434386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:24.586699Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.586699Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:bfcf4e80fbaeecc19aefd43657edef1c725ded808b13235e2f5f50a746070c68","observation_id":"b094b324-85bb-4d20-a9bd-d0850a8457f3","resolution":{"observed_at":"2026-08-02T06:36:24.586699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:24.708656Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.708656Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:5f4475c4e4a884f9c8cc5af12363304003a52d5a9d4040508cbdcbd700b5e243","observation_id":"3d7532ea-1a76-4089-8685-76e1def8cb2d","resolution":{"observed_at":"2026-08-02T06:36:24.708656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09154","last_updated":"2025-09-11T05:23:22Z","snapshot_observed_at":"2026-08-06T15:36:44.934159Z","submitted_at":"2025-09-11T05:23:22Z","title":"Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09154","snapshot_observed_at":"2026-08-02T06:36:24.824457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.824457Z"},"links":{"cited_paper":"/paper/2509.09154","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:9fb32dd554973949b4f4112ece872ba19fa76f88fa55eb3f1df540243b0c151b","observation_id":"dcaaf26d-9296-4499-b712-24025f374a1c","resolution":{"observed_at":"2026-08-02T06:36:24.824457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-16T12:46:13.492295Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-02T06:36:24.937558Z","title":"Zhang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.937558Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:162920c2b6bb8deaa930286a9a7ed73ab0115c1dfbba23fa2044a953667bb137","observation_id":"99b2cdff-0287-4c80-9628-7c449f15e83e","resolution":{"observed_at":"2026-08-02T06:36:24.937558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:25.061405Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.061405Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:44350450771c0943a602e63ccda0deb720da1a1458d879a5af557ffc83b21797","observation_id":"dc512e3e-e466-4a90-8c47-628dd342732c","resolution":{"observed_at":"2026-08-02T06:36:25.061405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:25.211712Z","title":"Kerbl, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.211712Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:f1e86012691b837c885788fbc67eb1f6e7586eac15686742cfe92c379b24440c","observation_id":"07695e67-3801-4bb5-9457-195b04239fd7","resolution":{"observed_at":"2026-08-02T06:36:25.211712Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25477","last_updated":"2026-08-17T22:23:14Z","snapshot_observed_at":"2026-08-20T08:18:37.945512Z","submitted_at":"2026-05-25T06:31:03Z","title":"EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25477","snapshot_observed_at":"2026-08-02T06:36:25.322195Z","title":"Dong, K.-H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.322195Z"},"links":{"cited_paper":"/paper/2605.25477","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:636f6f1afe65d3f90a3001ccf5d9124ce1eeb050d31a7defb0369ea318f34ef9","observation_id":"747ba7c1-671f-460c-aff3-31967cb72a5b","resolution":{"observed_at":"2026-08-02T06:36:25.322195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22896","last_updated":"2026-05-21T15:24:21Z","snapshot_observed_at":"2026-08-13T09:07:11.818716Z","submitted_at":"2026-05-21T15:24:21Z","title":"Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22896","snapshot_observed_at":"2026-08-02T06:36:25.474187Z","title":"Jin and Z","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.474187Z"},"links":{"cited_paper":"/paper/2605.22896","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:fb35d96463f7ee2cf5be2920f1e191bbfc267db3639bb4b5d70ad21145a8367b","observation_id":"588e9b20-3631-436a-bfd4-47658f49d517","resolution":{"observed_at":"2026-08-02T06:36:25.474187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18287","snapshot_observed_at":"2026-08-02T06:36:25.569578Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.569578Z"},"links":{"cited_paper":"/paper/2605.18287","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:1771f5d08134e3c3253468f8902260765dd5957ee0fd3740a294d8ba8371c384","observation_id":"b093e008-a336-4fdf-a256-0eca4df13610","resolution":{"observed_at":"2026-08-02T06:36:25.569578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:25.638249Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.638249Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:37d0a7cfcac802cefbdcf0dad6d4ea82fde8e03a41f5917a8814b239576e5838","observation_id":"e83d0989-1b30-42df-802f-5f6f2ef50b99","resolution":{"observed_at":"2026-08-02T06:36:25.638249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13403","last_updated":"2026-05-13T11:58:02Z","snapshot_observed_at":"2026-08-18T09:25:48.799150Z","submitted_at":"2026-05-13T11:58:02Z","title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13403","snapshot_observed_at":"2026-08-02T06:36:25.725257Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.725257Z"},"links":{"cited_paper":"/paper/2605.13403","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:6f9a7581425c3f1677763421084ba187063896aec2a4f6a5052ee71805ba4e2c","observation_id":"ac249eba-7ffc-4fec-b7d7-3a07e3507800","resolution":{"observed_at":"2026-08-02T06:36:25.725257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-13T14:45:19.660607Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10819","snapshot_observed_at":"2026-08-02T06:36:25.814637Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.814637Z"},"links":{"cited_paper":"/paper/2605.10819","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:08c77727c2085bc6e326ea5e0bebb987d8d8803e338e3cddcfc5cb5fe4aca7df","observation_id":"0a2acf44-ff19-4795-8b32-7a815184267b","resolution":{"observed_at":"2026-08-02T06:36:25.814637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-08-15T01:07:51.226843Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06175","snapshot_observed_at":"2026-08-02T06:36:25.966163Z","title":"Jiang, J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.966163Z"},"links":{"cited_paper":"/paper/2605.06175","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:1efbd44d3b3ce646a0269415487a7b32cc4d77a33adfc5f4466749cb83ba5e96","observation_id":"62d87d70-948a-4b0b-b1d6-a84fc2be323d","resolution":{"observed_at":"2026-08-02T06:36:25.966163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14712","last_updated":"2026-07-11T13:09:54Z","snapshot_observed_at":"2026-08-15T15:42:29.159558Z","submitted_at":"2026-05-14T11:31:02Z","title":"IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14712","snapshot_observed_at":"2026-08-02T06:36:26.046545Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.046545Z"},"links":{"cited_paper":"/paper/2605.14712","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:fb3ffbaec5dfb6701b9a460911d3f133a3dd76438e62272a998416a874378474","observation_id":"b57ffa9d-b742-43c4-956c-bf46e521fe9b","resolution":{"observed_at":"2026-08-02T06:36:26.046545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-08-02T06:36:26.185245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.185245Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:4f8d2388fab67169ae58902aada42d27481c19b5f1adb9d800914ea3fd27a5f4","observation_id":"b92120f6-af3b-4f60-816f-d59befd8112a","resolution":{"observed_at":"2026-08-02T06:36:26.185245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00695","last_updated":"2026-04-15T17:01:03Z","snapshot_observed_at":"2026-08-12T17:36:16.455110Z","submitted_at":"2025-10-01T09:15:52Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00695","snapshot_observed_at":"2026-08-02T06:36:26.230688Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.230688Z"},"links":{"cited_paper":"/paper/2510.00695","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:f8dabd784e02d7c4f9088f15a0ba36e76a3a2fcf7e2ca2305bde5661dc64edcf","observation_id":"e41edba5-264a-4150-a89c-5e86ee5dad7f","resolution":{"observed_at":"2026-08-02T06:36:26.230688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-18T11:53:44.017837Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18960","snapshot_observed_at":"2026-08-02T06:36:26.285518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.285518Z"},"links":{"cited_paper":"/paper/2511.18960","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:384f9b357119fb045df34814cee51f46ead4591accba8e99f1e5e7d8ea53c100","observation_id":"678e3869-43aa-4d9c-90b4-02b6de665d10","resolution":{"observed_at":"2026-08-02T06:36:26.285518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.358728Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.358728Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:3e3c361c6ac458f293736678c6c32c23dd05cef24075eb9f42ae32b56e45811a","observation_id":"26c6d27c-6026-4b2a-a047-b74c2aa33b8c","resolution":{"observed_at":"2026-08-02T06:36:26.358728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.420967Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.420967Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:383432fd0a53775e76d976fe5e39138350cc290fd75e060bc2bea01c280762af","observation_id":"3e552af0-98f4-4abe-8159-cf629131dd3e","resolution":{"observed_at":"2026-08-02T06:36:26.420967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.496980Z","title":"Zhong, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.496980Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:2b9e1a8937d868f658abc134b66f36f95018f3a4e7e6caa29e0cb1d8a580cccc","observation_id":"7bb5200c-7376-47ff-84f0-ea7fd17d63b6","resolution":{"observed_at":"2026-08-02T06:36:26.496980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-02T06:36:26.553612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.553612Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:3cde3e7b48cac7940d1fe637beb19a9672ef8da4ca09c2f0d4a2fdb05660913f","observation_id":"285f291e-49c2-4ca1-864c-b90062978eb1","resolution":{"observed_at":"2026-08-02T06:36:26.553612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-02T06:36:26.629789Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.629789Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:fc35308dc23c21665977f46e5fe459325e39966763cce5b7a83091778eba6e9c","observation_id":"856e1487-93bc-4916-9ee1-2bf9a0884165","resolution":{"observed_at":"2026-08-02T06:36:26.629789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.684473Z","title":"Singh, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.684473Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:fe92fa081c70e8aeca0dba0e947e4c16793379e613dcd4ef4d5ef2c0ca579b30","observation_id":"e2a352d2-f894-44b5-9a99-009efb0bbaa4","resolution":{"observed_at":"2026-08-02T06:36:26.684473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.729640Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.729640Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:2f73bb71f3e7b53e8c6f02369b099fd0878ca614a96566b09b6d4da9fcdbda6e","observation_id":"4bb6d338-22ee-4b8a-b9a1-6349f240c75c","resolution":{"observed_at":"2026-08-02T06:36:26.729640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.850155Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.850155Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:16d71c71a3c495d37c81bc459608fb5a57060a2ad29577fb5ad453e480b2b9ed","observation_id":"36571b98-c032-4692-a15f-bf33409bee6a","resolution":{"observed_at":"2026-08-02T06:36:26.850155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10698","last_updated":"2026-02-11T09:57:32Z","snapshot_observed_at":"2026-08-11T15:16:51.530916Z","submitted_at":"2026-02-11T09:57:32Z","title":"AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10698","snapshot_observed_at":"2026-08-02T06:36:26.905286Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.905286Z"},"links":{"cited_paper":"/paper/2602.10698","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:882f85c99265c364118861479020a085fc43d7286739ff3bacef1e6ae09e6e7c","observation_id":"d8d3d563-4530-43dd-bd7d-4e75249fa27e","resolution":{"observed_at":"2026-08-02T06:36:26.905286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14950","last_updated":"2026-05-14T15:21:36Z","snapshot_observed_at":"2026-08-20T08:09:50.523612Z","submitted_at":"2026-05-14T15:21:36Z","title":"Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14950","snapshot_observed_at":"2026-08-02T06:36:27.011871Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.011871Z"},"links":{"cited_paper":"/paper/2605.14950","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:6026cfd505527f8bebfa7a7d4b65f0358b06b8eeac26e170577350a231a81f41","observation_id":"fd342961-3d45-43e2-95e8-236099fbf0c5","resolution":{"observed_at":"2026-08-02T06:36:27.011871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.140283Z","title":"Song and L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.140283Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:c0b635165a568e0946d7df4fd6cbc27895e038fc28bccb2626300823fec66dd8","observation_id":"5b8b823b-8b83-4b7f-b9eb-630c75bc0074","resolution":{"observed_at":"2026-08-02T06:36:27.140283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.284319Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.284319Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:cce90490a1844a4016ce3456cc19fee2ee5b8258595abbb39e323daccc1b3c7d","observation_id":"595a50de-1aa7-467b-800b-ea78f41607ef","resolution":{"observed_at":"2026-08-02T06:36:27.284319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-02T06:36:27.368310Z","title":"Huang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.368310Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:bedcda986cc243188052bb9bfac5160f254a3f684aaa86399e4bac008cceea1a","observation_id":"4a2bf18c-6494-44e4-b6a3-ad0de77e6d30","resolution":{"observed_at":"2026-08-02T06:36:27.368310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.419567Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.419567Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:ef518613ab61b1e5c04245f69f5e0b0611228c36b1038bb70136f0ec556fc77f","observation_id":"9edd6e92-26e8-4451-9216-fbe040a03edd","resolution":{"observed_at":"2026-08-02T06:36:27.419567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.513143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.513143Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:b9b4bd37f40f1330d5add48e90427a786405d74e0339964c2229030bf5d32952","observation_id":"ab0dbac5-59c5-4f21-885a-3fa1d1fd0bec","resolution":{"observed_at":"2026-08-02T06:36:27.513143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-02T06:36:27.565496Z","title":"Cheng, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.565496Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:481012ce175c67cc3afebf2c364ac49d92fbfc327aa349089a9a0dbb5028b74b","observation_id":"d5f799bb-513d-43f3-aa90-2c83bb44d230","resolution":{"observed_at":"2026-08-02T06:36:27.565496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.618097Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.618097Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:40afce1d1b9dd352a2e2567a05ff6293ef42fe38c778bded46970757350d148c","observation_id":"a592d654-79b0-4b1e-9642-216ac4110483","resolution":{"observed_at":"2026-08-02T06:36:27.618097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.697323Z","title":"Zhang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.697323Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:30f37fc1fd29890bca1e4f0f01ac3cad94cd4d982c07bfbb2a9fa6dc475d6bb3","observation_id":"e5399de5-a85f-43e7-b052-6accbc6ee565","resolution":{"observed_at":"2026-08-02T06:36:27.697323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:27.801921Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.801921Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:6229cdbd9c0a6561a479ca14d152d29ea9ead99680f042033a9edff784b242e6","observation_id":"0bdbb5ac-e99d-48e2-8a02-ed5fe07c2aa6","resolution":{"observed_at":"2026-08-02T06:36:27.801921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13632","last_updated":"2026-07-21T08:04:45Z","snapshot_observed_at":"2026-08-02T14:10:02.956697Z","submitted_at":"2026-05-13T14:58:29Z","title":"Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13632","snapshot_observed_at":"2026-08-02T06:36:27.913001Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.913001Z"},"links":{"cited_paper":"/paper/2605.13632","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:a18d225c0d97752a983afa35d2304205d773be3d377d6eea6d6b08a4ff642cd9","observation_id":"4c54af72-ea1d-41af-8765-648baeec7b47","resolution":{"observed_at":"2026-08-02T06:36:27.913001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22183","snapshot_observed_at":"2026-08-02T06:36:28.020890Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.020890Z"},"links":{"cited_paper":"/paper/2605.22183","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:f7ee9b4ef3b0a5b02f18566b3172b6d494c323b23c377b16549982c91c5edf9b","observation_id":"374d8661-814f-40ec-b1c2-2dd2de87bcf3","resolution":{"observed_at":"2026-08-02T06:36:28.020890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:28.144957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.144957Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:e9a4e768bab00d1f800714a737db5fc37de652a60a1aff0ffffc756a52fea83c","observation_id":"5b6061eb-db3d-4841-bc43-42f8c5d0c6ee","resolution":{"observed_at":"2026-08-02T06:36:28.144957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-08-19T21:45:06.745585Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-02T06:36:28.362385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.362385Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:34860b1e62ade3ce80e5447d9a8e2acaa58ed29874009171094ab1f8e3588875","observation_id":"b6dec961-c3a1-4103-85c5-fef2634108f7","resolution":{"observed_at":"2026-08-02T06:36:28.362385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:28.248849Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.248849Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:ee96be8448202acfb454315c44e4cd0f89614ab595e6e26fdc74f2b42d0a4f42","observation_id":"d2c1341c-f599-4d90-82b5-673d55bd3241","resolution":{"observed_at":"2026-08-02T06:36:28.248849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.765","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"498ce79b-56c7-4460-b86e-598efcc189c8","year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.638499Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:c4ff47a072da0f0ca452a77dc7e4b3badc36c6adb6388cd536b700b8d540d0db","observation_id":"2717740a-0985-4e62-ab15-8ecb33c7afb4","resolution":{"observed_at":"2026-08-02T06:38:21.988317Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.123","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"d02259a6-cf2e-4048-82de-5b25ca0115e8","year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.486974Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:e4f0c677623c4d5bf94b9a3f31dcc3f2ab2c3c4317cfb564134b64fae87dd981","observation_id":"afcfe4e2-4e30-431c-8eaf-1de2777d04dd","resolution":{"observed_at":"2026-08-02T06:38:22.125570Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12337","last_updated":"2024-04-04T19:04:55Z","snapshot_observed_at":"2026-08-16T14:33:17.776789Z","submitted_at":"2023-12-19T17:03:50Z","title":"pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12337","snapshot_observed_at":"2026-08-02T06:36:28.917434Z","title":"Charatan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.917434Z"},"links":{"cited_paper":"/paper/2312.12337","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:4495ef993a238686fc605067126d77efc806329ae428ca087a2d56d4acb73585","observation_id":"261e4ebe-0fbc-4af0-a279-04c7d1ab91a4","resolution":{"observed_at":"2026-08-02T06:36:28.917434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:28.761427Z","title":"Yu and S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.761427Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:c86498adb42041d0fcb9c2c65724e63686c78fbb9773299a486f0f004e158777","observation_id":"c57959c9-c099-44ae-a2b0-f8bde02e5bfe","resolution":{"observed_at":"2026-08-02T06:36:28.761427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13862","last_updated":"2025-03-25T15:20:52Z","snapshot_observed_at":"2026-08-18T09:56:51.777218Z","submitted_at":"2024-10-17T17:59:58Z","title":"DepthSplat: Connecting Gaussian Splatting and Depth","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13862","snapshot_observed_at":"2026-08-02T06:36:29.145230Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.145230Z"},"links":{"cited_paper":"/paper/2410.13862","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:8e8f27f4ee0393f8d8fd9a7d35389ce871a46e94c80100ddabe08d0bf0de596c","observation_id":"ce2aee0d-973d-415c-be84-701d2da17d52","resolution":{"observed_at":"2026-08-02T06:36:29.145230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.054429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.054429Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:9c63727fbf28c62abaeb49b4bd896b2f89ecea7de2a5d8f930aa30e1a1620895","observation_id":"40eed0c5-6b15-4066-9c68-9d7eeaeef615","resolution":{"observed_at":"2026-08-02T06:36:29.054429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.404953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.404953Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:0a336361d1c2377ed5403900a5b78763315b3d35e4edce9040ef5255a90e652b","observation_id":"e19f7acb-1b62-47bb-b996-72ae1a996b4b","resolution":{"observed_at":"2026-08-02T06:36:29.404953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.314737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.314737Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:19713f7f706718371935d0717ce9ca540dc690c5d9ffbed0acfcc569338595f6","observation_id":"6180bd0b-eec9-457c-bfe2-db9939f0dc29","resolution":{"observed_at":"2026-08-02T06:36:29.314737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.545799Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.545799Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:93753db02661e2b6e79ec2403e3bbc09b6ce9a535d32a1363caea7f1018332f7","observation_id":"9f7aefe1-0f95-4b88-9ced-2887d97d6679","resolution":{"observed_at":"2026-08-02T06:36:29.545799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.471224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.471224Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:678c4bbb1fbfdbedfd27769f0e9cd7db9764bbd83e3cfa6462332bd8142fc618","observation_id":"dca25110-4cda-45fc-8d3f-9ad509e8348b","resolution":{"observed_at":"2026-08-02T06:36:29.471224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.718037Z","title":"Zheng, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.718037Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:f551c61b794a543faddd50e28abd390caa32befb69d4d413c501656bc4fd02ba","observation_id":"0f8cba9a-b2dd-46e6-8e67-7f2b98a241c6","resolution":{"observed_at":"2026-08-02T06:36:29.718037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20752","last_updated":"2026-05-28T12:25:46Z","snapshot_observed_at":"2026-08-16T02:30:02.995174Z","submitted_at":"2026-05-20T05:51:30Z","title":"GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20752","snapshot_observed_at":"2026-08-02T06:36:29.666960Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.666960Z"},"links":{"cited_paper":"/paper/2605.20752","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:cadb38b1a6f284042bf3a7c2dba0684d5a0d64b7751950d6f02cb6113562f670","observation_id":"c7fc3916-b4f7-432d-89d8-9fb6bf9c4d28","resolution":{"observed_at":"2026-08-02T06:36:29.666960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02140","last_updated":"2024-12-03T03:56:01Z","snapshot_observed_at":"2026-08-17T18:38:20.365485Z","submitted_at":"2024-12-03T03:56:01Z","title":"SparseGrasp: Robotic Grasping via 3D Semantic Gaussian Splatting from Sparse Multi-View RGB Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02140","snapshot_observed_at":"2026-08-02T06:36:29.838948Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.838948Z"},"links":{"cited_paper":"/paper/2412.02140","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:9621f0349c04c300fa2631977545a19a1ad91df8211951261c3bd10658526269","observation_id":"e6ae6ae7-86f6-41e9-ad30-3d38f35d5525","resolution":{"observed_at":"2026-08-02T06:36:29.838948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.775578Z","title":"Ji, R.-Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.775578Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:d9b47705b0c82af1409709cb6103ef61be43649f885d7cfdeebf99468197afb4","observation_id":"c3019d27-4594-4c14-a154-24ce47b4cefa","resolution":{"observed_at":"2026-08-02T06:36:29.775578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.985008Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.985008Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:e2c007d96d3f0231c7df75a9cd3a0ec778109b31fc4078c7b87c0ed1fa0bd414","observation_id":"3cd6abcc-3cda-42f5-af55-0a11661e2089","resolution":{"observed_at":"2026-08-02T06:36:29.985008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:29.923106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:29.923106Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:631a3af0861af4589c6a2ea334541386a3792fd81789dd441d002bf6a48c0163","observation_id":"9e406177-6b26-49dd-874c-613ef6c8991e","resolution":{"observed_at":"2026-08-02T06:36:29.923106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.083416Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.083416Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:ad9bd3dad10e70ea80b84e6a71594dd104053bf75226bcc79442086019097de3","observation_id":"919c53e8-5f0a-4819-9efd-63bb417a577a","resolution":{"observed_at":"2026-08-02T06:36:30.083416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14135","last_updated":"2026-05-22T16:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T02:55:20Z","title":"GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14135","snapshot_observed_at":"2026-08-02T06:36:30.031299Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.031299Z"},"links":{"cited_paper":"/paper/2506.14135","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:8c4cd9f6d30b32fb757ef578fed9bc33ac48c4315e38db107a9c1a94e4ac4547","observation_id":"f121a439-c39d-488d-8181-1120bfed1511","resolution":{"observed_at":"2026-08-02T06:36:30.031299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.192398Z","title":"Matsuki, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.192398Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:8a08b58f0ed89d548499dfda8492c08e9ed73c196417df56068924e1ed5eacc0","observation_id":"fe70aa34-3d69-4b51-877e-56934157fd47","resolution":{"observed_at":"2026-08-02T06:36:30.192398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.140157Z","title":"Keetha, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.140157Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:46079756eb75472cb4558d71f9e81e96363f36450f58eb3b31a6f8368b6c0eb0","observation_id":"7d0c5264-af72-4ae0-b8b6-0b36d4e9915c","resolution":{"observed_at":"2026-08-02T06:36:30.140157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.322766Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.322766Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:0d3db55887dae92c2be397266b16b21d103683da78c198a89c4584a4c32495fc","observation_id":"ccaef96e-a275-4ec2-b647-bdbb0d2438ac","resolution":{"observed_at":"2026-08-02T06:36:30.322766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.261423Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.261423Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:8416cd4543656dc29b9f830af2d652eb8443fd31daa56e09703078d1303e03e1","observation_id":"88fd87d8-dd02-4322-8b03-a627d30e23ad","resolution":{"observed_at":"2026-08-02T06:36:30.261423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.507984Z","title":"Alayrac, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.507984Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:b364dfbfb8d490d0329beee1eec9db5f0ab78229f1876c6609312f9c691bf724","observation_id":"0c6baf4b-6f27-41c8-91ea-53d6047d9994","resolution":{"observed_at":"2026-08-02T06:36:30.507984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.371110Z","title":"Bolya, C.-Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.371110Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:c35219bcc6621a82aecc22207f495dc2bf532b5bbf45d3e320b5b8f4f8ed68db","observation_id":"eb7ec8e7-a5e3-4822-82a8-51941c95d347","resolution":{"observed_at":"2026-08-02T06:36:30.371110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.677198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.677198Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:b9888089fc1ffaa87eb9f90e165ed4cb520fa09b190ae6a295025b1e72e9c3ad","observation_id":"a54526cf-284f-4a21-b1cd-8654dabd0536","resolution":{"observed_at":"2026-08-02T06:36:30.677198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.614447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.614447Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:272db7ff0d8120b73d0a8d6f7f407aa170bbdedb844761a6a98fb5544f46f13a","observation_id":"fbeb7a75-eb20-40dc-a2d1-1fe02bc9e782","resolution":{"observed_at":"2026-08-02T06:36:30.614447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.939646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.939646Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:7e323c0cb948e91baf48649676ffc1d8e8bfd6d71d0700e5c011627740ca6166","observation_id":"f61ab38c-bff6-4c36-9cb3-3fe137d07e3f","resolution":{"observed_at":"2026-08-02T06:36:30.939646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:30.765726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:30.765726Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:679edafdd9a1957f6d1001175d1f9f2e4d6c31c7f6945c4e239b81063e25ad59","observation_id":"3ec85fae-2e35-4225-ab24-780355a06889","resolution":{"observed_at":"2026-08-02T06:36:30.765726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T06:36:31.130222Z","title":"Oquab, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.130222Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:50face8c02c1689f57216827f8f028c76503c3d5461123209b1a1fd83496f4e1","observation_id":"f8abccb1-2338-48fd-954f-6611da33aab4","resolution":{"observed_at":"2026-08-02T06:36:31.130222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-02T06:36:31.043583Z","title":"Tschannen, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.043583Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:0d624527f8d7fe5684fa3ade85e524caa854050456405c572c22792bdd85e2af","observation_id":"8b619efe-5716-4215-99d4-6a898b7611be","resolution":{"observed_at":"2026-08-02T06:36:31.043583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-18T04:25:30.115862Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-02T06:36:31.254570Z","title":"Shukor, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.254570Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:6a4a9d3778ba877f12a0e297f6ffb3b554ebdf17ecc70a9514745cbf5371518c","observation_id":"7cf849c0-47ca-4ad3-baa8-1da2d081d8a6","resolution":{"observed_at":"2026-08-02T06:36:31.254570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:31.194186Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.194186Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:b730039599a47c5fee2ec58e32a8d7538a46da36cce6c67740e54597880abeeb","observation_id":"c7c0b313-4e5b-4ed7-a0b9-864fd0eae00f","resolution":{"observed_at":"2026-08-02T06:36:31.194186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-02T06:36:31.358077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.358077Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:633a2c61396fb8afd9875537f03423061a30f7e66295762b50f8db50198f9c9b","observation_id":"83676e7d-9849-4123-b2c0-4a31b315366c","resolution":{"observed_at":"2026-08-02T06:36:31.358077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:31.312866Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.312866Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:ba99bdf12f98d4ddfeaadc1828a1f692cf0e6b251b7c29dd2d52fc25a2340f02","observation_id":"73a06604-7925-41b2-af30-5cd52ba86cb2","resolution":{"observed_at":"2026-08-02T06:36:31.312866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-08-14T09:44:01.476519Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-02T06:36:31.560478Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.560478Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:ce8609fbedbec9f65d15d3e14553736d468c1dc52f223e7bf670e919897f5951","observation_id":"cd493ad5-0320-47b0-833f-4a637571a57e","resolution":{"observed_at":"2026-08-02T06:36:31.560478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:31.414302Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.414302Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:a6128ddd90a706a41259b1a5230bb81cdfb12e430503bbf87cc4f7b7e85e1308","observation_id":"3a258a62-8a77-4597-b042-411de9166e0b","resolution":{"observed_at":"2026-08-02T06:36:31.414302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-02T06:36:31.798266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.798266Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:fb17bbb94d3cbdbe85a6fc19b284d71554142b719bdafc0d6a758080f5bb6802","observation_id":"4ecbb209-b7ca-4b3d-9c9c-49490d40cdf7","resolution":{"observed_at":"2026-08-02T06:36:31.798266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T06:36:31.658994Z","title":"Bjorck, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.658994Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:80baf97201b5cb578b9d5bc7705e25ea641189e14000de0ba6d90de916d23d94","observation_id":"02c86c3e-688e-4822-aa5f-8a0f648677c8","resolution":{"observed_at":"2026-08-02T06:36:31.658994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-02T06:36:31.872581Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:31.872581Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:95406fab4621646dadc76d21077440cc471712ace5514c44f0b140645050ffb2","observation_id":"3f0f5a5d-2f5f-4a94-a74a-ac5a6096a3b7","resolution":{"observed_at":"2026-08-02T06:36:31.872581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:36:26.795680Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.795680Z"},"links":{"citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:0f5d0c0f8127d7dcb563c900e578585f54a2afa4eac15cdb4b18c476fa63dbaa","observation_id":"44c8a592-a981-4d45-8342-f39758b06922","resolution":{"observed_at":"2026-08-02T06:36:26.795680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2607.12356."}