{"as_of":"2026-08-15T16:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16925c4ba52c5ce88ef9245a2b1756262b0c1ada2f021273f85b4ec20ecf3d69","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:59:04.663968Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:38:20.785896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-03T17:38:20.785896Z","title":"Graphcot-vla: A 3d spatial- aware reasoning vision-language-action model for robotic manipulation with ambiguous in- structions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-13T12:16:49.743297Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.785896Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:897a9fff75be185f80f91658b9a3cd01715ae6da7ca9ef793b7a19df7f55eeea","observation_id":"cfaa48a2-6d08-4c1e-8e5f-e7a9f4ae9992","resolution":{"observed_at":"2026-08-03T17:38:20.785896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2604.09824","last_updated":"2026-04-10T18:56:48Z","snapshot_observed_at":"2026-08-15T06:42:41.368226Z","submitted_at":"2026-04-10T18:56:48Z","title":"ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:19.995405Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2604.09824"},"observation_digest":"sha256:771a3445b6e238405eb271c72458b8411bb164645e3f7d397d9a4f8eb7f19510","observation_id":"6f36ca5f-1c77-4b7a-acf9-74fb39086d8e","resolution":{"observed_at":"2026-05-11T08:30:57.258483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.05714","last_updated":"2026-05-07T05:57:49Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:57:49Z","title":"TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T14:54:48.058400Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.05714"},"observation_digest":"sha256:ace6e69ca81325d220135f9dfbf464cf0976433ca778e7e330ab0a1d27f06cf1","observation_id":"88d240b7-7eaf-43ec-a10e-27dd97ffe09f","resolution":{"observed_at":"2026-05-11T18:36:09.179305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.12162","last_updated":"2026-05-12T14:13:06Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:13:06Z","title":"X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:07.792757Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.12162"},"observation_digest":"sha256:f0a0240ec941813d7dc572efb10c053a4174ebd1243eec691c55851be804eb7b","observation_id":"7b5158b3-e675-40d2-8a40-aa4907ff9396","resolution":{"observed_at":"2026-05-13T04:52:17.025802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:082995cde77338b2f8a56312b4d9ceb11f7fb0f606f20ee910386f72b9a2dd99","observation_id":"5f93b8ea-0f8e-4842-9f73-437ff3206344","resolution":{"observed_at":"2026-05-14T17:57:33.311170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.14598","last_updated":"2026-05-21T03:24:31Z","snapshot_observed_at":"2026-08-15T04:53:54.970032Z","submitted_at":"2026-05-14T09:06:01Z","title":"DSSP: Diffusion State Space Policy with Full-History Encoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T10:17:44.804745Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.14598"},"observation_digest":"sha256:80fdc0fd2b941019df6901a14df625fbfe054fb694105463b4b3ab435a73fa28","observation_id":"963a8b05-0fcc-418c-907c-038d6af2d935","resolution":{"observed_at":"2026-05-22T10:21:24.247338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-14T15:31:53.553432Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:5c1d5ac89f2c880ed4d02866f69fa0f0a8034ee697b503535666b4459c3f6ddb","observation_id":"8af57b5b-6e93-4cc6-9456-acc96e48fe0f","resolution":{"observed_at":"2026-06-27T22:01:20.749485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-02T06:36:27.368310Z","title":"Huang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-15T10:29:21.923858Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.368310Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:aed3c3a710df3c3a8f38504ff7eebfcf1e5686251940fc50541911df695cfb36","observation_id":"4a2bf18c-6494-44e4-b6a3-ad0de77e6d30","resolution":{"observed_at":"2026-08-02T06:36:27.368310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07650/citation-record","integrity":"/paper/2508.07650/integrity","json":"/paper/2508.07650/citation-record.json","paper":"/paper/2508.07650"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:00.281025Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.281025Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:5ac738ac6d630a601498a4cadaeb80e4c96a020c292077dcb62fbbf35dd9dd25","observation_id":"0a654059-9e67-4146-9782-73063cb25d2a","resolution":{"observed_at":"2026-08-05T21:59:00.281025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:00.374741Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.374741Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:d05808cf4e0bc9e1ad18d02c285c96c0821dcb80634b9b0ef6f136cfda7e5570","observation_id":"633a45ab-0d9e-4ef9-b84a-796c397622bc","resolution":{"observed_at":"2026-08-05T21:59:00.374741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T21:59:00.513385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.513385Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:6b6ad28c09c5d44bd22942f4986dd8bcf0e1ec2ddfe3a7b5b9f7730896ff3d23","observation_id":"d5704008-07ae-4823-999f-98e7addf7ddd","resolution":{"observed_at":"2026-08-05T21:59:00.513385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T21:59:00.642456Z","title":"S.; Kolesnikov, A.; Wang, X.; Salz, D.; Neumann, M.; Alabdulmohsin, I.; Tschannen, M.; Bugliarello, E.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.642456Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:ab5e0b5e2b23a6890269f0ca0a4e41368c2b57f875454d6d27d927554bc90535","observation_id":"4b160908-3609-46e3-bba5-8edf69cc572f","resolution":{"observed_at":"2026-08-05T21:59:00.642456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T21:59:00.765491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.765491Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:0f841b011c07a77deb7c1320b8fb4e854299fa5e77823d553f7b92ebf10af876","observation_id":"1559dab7-3594-454f-bd9f-302cac670c54","resolution":{"observed_at":"2026-08-05T21:59:00.765491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T21:59:00.915445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.915445Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:347ef8e2e04e30a307d52263dc0ecd3ead9fca9c56b854d746c047374c4eda43","observation_id":"2ab685a4-4b7f-4a09-b1be-3b9db0277c27","resolution":{"observed_at":"2026-08-05T21:59:00.915445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T21:59:01.047936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.047936Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:5832c457321e27222dfd6ca3542a0232b39a84b826ff629c03f925e49ccb90bb","observation_id":"c99be82a-8dec-4b14-9ead-6d31a1e9b659","resolution":{"observed_at":"2026-08-05T21:59:01.047936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-13T06:01:31.708891Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08243","snapshot_observed_at":"2026-08-05T21:59:01.209286Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.209286Z"},"links":{"cited_paper":"/paper/2505.08243","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:966c72fdfbbf9f3a73d1b18c0198bb6e99b7bc687945d97d8fd6b8468ffe3f87","observation_id":"20ff8100-4ca7-47bb-9441-8c965fb14dc3","resolution":{"observed_at":"2026-08-05T21:59:01.209286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:01.316143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.316143Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:3e351b687396a0d4481aaff577bb808c99c2e8e775a7b6a04450444b3725211b","observation_id":"6dd3773a-3739-4d0c-ac3d-15d3faa5cb56","resolution":{"observed_at":"2026-08-05T21:59:01.316143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:01.465144Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.465144Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:022273bb30766aab1b152a1c12afb11ba3493907e7f48b9fa0503ba1f057ded7","observation_id":"c0535c25-b455-4093-be57-bbe23e6ed593","resolution":{"observed_at":"2026-08-05T21:59:01.465144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:01.586486Z","title":"U.; Akram, W.; Saoud, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.586486Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:b4110cd55c915d7a9985c695acf57e0c60d53ed670dc85b55abb75a7b31841d4","observation_id":"8112ce35-afb6-4377-be70-593bac236238","resolution":{"observed_at":"2026-08-05T21:59:01.586486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T21:59:01.753969Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.753969Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:663cf3e86d24aaddf305fea600548bc0cc6502526c447e3615eb21aec934640e","observation_id":"9c7419bf-4469-49a7-aeb0-36cf0ae16ef8","resolution":{"observed_at":"2026-08-05T21:59:01.753969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T21:59:01.879712Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.879712Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:6e941191b4629a415fab0ae79cef77c36c174c5ce1a2d5d32c4fce813c5a840d","observation_id":"cbf66c8f-7dff-4bcf-af3d-5e294652bcc7","resolution":{"observed_at":"2026-08-05T21:59:01.879712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T21:59:01.984771Z","title":"T.; Ben-Hamu, H.; Nickel, M.; and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.984771Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:abccf67209e0ddfe0f65d233d3d278b1b9f9d0a704004a554344e9d5a0f64f4a","observation_id":"f22f2f3f-3975-4f85-88c5-a93078de177f","resolution":{"observed_at":"2026-08-05T21:59:01.984771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T21:59:02.125016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.125016Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:14096a96b26988c470be0b14170c3d7e6421feec03e7d58343eb6305c3cd9c90","observation_id":"21b237a7-900b-4669-83fe-c4bb2e4577ba","resolution":{"observed_at":"2026-08-05T21:59:02.125016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.999291Z","title":null,"venue":null,"work_id":"6a6d8d37-a463-4f1c-85d3-bc1d8c3a228e","year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.219607Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:029cf785b635ea3363bd366f6270bc1cbfa7d64ddb7248b247388fa05dc25d72","observation_id":"d2a5271a-649c-47e2-89a7-f093f194ff20","resolution":{"observed_at":"2026-08-05T21:59:06.090482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:02.395778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.395778Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:a96fcf0f723e4f2694de25d4217ac8c519c7967f5b1c9a6c94d09bf723661c8f","observation_id":"2d951652-97cf-4845-b9e3-30536abadda5","resolution":{"observed_at":"2026-08-05T21:59:02.395778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T21:59:02.521887Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.521887Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:3311f1f386cf556ecd56e8e4f67c15bb4a0ff399ff3da740004ccf7f44ab8a0f","observation_id":"3972e8e3-e061-4e2c-a015-369cad400f00","resolution":{"observed_at":"2026-08-05T21:59:02.521887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:02.669629Z","title":"C.; Hagenbuchner, M.; and Monfardini, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.669629Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:9fd01c77a719a9c4dd6de89635ebe571548cad12e9eeaaf0966672a69b442ca1","observation_id":"1d9a072c-0eda-4c4d-b4ff-bd99563f9f45","resolution":{"observed_at":"2026-08-05T21:59:02.669629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T21:59:02.850855Z","title":"M.; Ghosh, D.; Walke, H.; Pertsch, K.; Black, K.; Mees, O.; Dasari, S.; Hejna, J.; Kreiman, T.; Xu, C.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.850855Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:ec6c086b22e2ef673ed3ee5f77afbe955d3cb986a68a434a88e7b461e1a8e71d","observation_id":"387a2d33-f234-4fb8-8dc5-7b234f572307","resolution":{"observed_at":"2026-08-05T21:59:02.850855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:03.028529Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.028529Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:77f8b25518dbd305234f424f08814f3144ce0b84c116f374b1e3e967016a755d","observation_id":"1eb08441-3332-416c-85bb-0788f87d9060","resolution":{"observed_at":"2026-08-05T21:59:03.028529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19510","last_updated":"2025-03-25T10:01:57Z","snapshot_observed_at":"2026-08-07T16:38:50.733709Z","submitted_at":"2025-03-25T10:01:57Z","title":"RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19510","snapshot_observed_at":"2026-08-05T21:59:03.238165Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.238165Z"},"links":{"cited_paper":"/paper/2503.19510","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:5516282b356bf945eab0ae43d6065713b035196eb6596d90e138365bad328e7a","observation_id":"46b3d570-56a7-4917-9861-7454eaa9e4de","resolution":{"observed_at":"2026-08-05T21:59:03.238165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:03.360868Z","title":"V.; Zhou, D.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.360868Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:aa0a5782cd8e7702f7e49c7e20661462edf53b21f1315aaaa5f083eac038237f","observation_id":"ed56506c-f6b4-4bdb-9e27-8837f393f21b","resolution":{"observed_at":"2026-08-05T21:59:03.360868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-15T01:35:58.775756Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T21:59:03.506693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.506693Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:908992ec3a5ef8338beb18b9e82d6ce9647c8ec3a51cf584b5a16073ac8b2563","observation_id":"8a3068a2-2413-4b17-893b-59a5f87d8200","resolution":{"observed_at":"2026-08-05T21:59:03.506693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-05T21:59:03.685804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.685804Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:9d362a82cdda96cb39012b1bee949143bc31b0beee4b64ba0975d67def05fb6f","observation_id":"c37b3efa-6603-4150-a9d7-3b8038644537","resolution":{"observed_at":"2026-08-05T21:59:03.685804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.697407Z","title":null,"venue":null,"work_id":"6d0a81ea-8128-4d3b-b6c8-3d4cfc89cfc4","year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.815934Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:72e45af78d61f109921bdfa0e7820c36365c94fa47f0a2c5cef76df435212f5e","observation_id":"937d58e2-100c-4b34-8746-37cb3ae1f068","resolution":{"observed_at":"2026-08-05T21:59:05.824403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-05T21:59:03.989579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.989579Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:8f569eca38d68f9a74712c8345cf3f99439e5c5b52d1251dade6132a9e46aa06","observation_id":"607ad875-3aa4-405e-8f2a-2638e625de80","resolution":{"observed_at":"2026-08-05T21:59:03.989579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-05T21:59:04.110925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.110925Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:f5046d4f31f6e104ada1bb3d13acc195962181c2f4584fe7387e526a6be0ea75","observation_id":"10fcbea8-bb85-41dc-8eb6-083a24f9dbee","resolution":{"observed_at":"2026-08-05T21:59:04.110925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.404478Z","title":null,"venue":null,"work_id":"99190d6a-8622-4236-aa0e-70a876d452fd","year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.244235Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:8ee2f6b6bd5a4778ce783d43979cafa4beadd5d9cbfdec41e0ed90a0d4de1a66","observation_id":"fc824915-7486-47f8-a96f-94bace06dedf","resolution":{"observed_at":"2026-08-05T21:59:05.549634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.115107Z","title":"J.; Fu, Z.; Zhang, Z.; Wu, Y.; Li, Z.; Ma, Q.; Han, S.; Finn, C.; et al","venue":null,"work_id":"2e08e62f-6a18-4c9d-8a90-0057c06e01a3","year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.376600Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:357cdd8373357d37b496f6f264f4c3e194251670f7952c2a19f6bea504103aa7","observation_id":"b6b0a23a-ae10-4209-9a43-49c754fc910d","resolution":{"observed_at":"2026-08-05T21:59:05.235334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T21:59:04.551521Z","title":"Z.; Kumar, V.; Levine, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.551521Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:8cd32340949601da89d0add12ff54cd43575ae065dcac88eae3e463664c2c8da","observation_id":"a04cce51-79b9-43fb-ada7-aafa8657335a","resolution":{"observed_at":"2026-08-05T21:59:04.551521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:04.663968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.663968Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:35fcf42a846813940758b16ca5c6c8eb6bdc97b6aa0a6025a6479315056a481b","observation_id":"e7a23773-4d3a-433b-bee1-e3af492139df","resolution":{"observed_at":"2026-08-05T21:59:04.663968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 8 inbound Pith citation observations for arXiv:2508.07650."}