{"as_of":"2026-08-11T17:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20b03427796b9ed9e94fb009038dd2617a8fabfc068201acde497fd797730787","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:00:20.896966Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:19:48.331513Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:33:45.452965Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:21:45.365156Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:4183f4e9d19d11e545bc414764628b317067c8cbfce1677756e87b5a4e9ae0d5","observation_id":"29bcc586-fdd6-4570-a3f1-1810b5506305","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:53:44.901684Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:2d87e0ce417571b95cddf21eece43131e9825d53834f0d844c6592f8ef54042f","observation_id":"ff9f8454-ac41-4d72-a36f-9a1ebc423a2c","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:479b83d9d22bf7f9f99c897b6141d5a425bda93fb1843c7cbfc06d02470cb21b","observation_id":"5f5dc25b-ad35-4b5c-8263-6d52775a873b","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T03:57:10.338617Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:fb7ce34bab7ab0e73956f48c48cf31c2d1f6ffc1473f1bea09da42c966999da9","observation_id":"f801e2ea-02e8-4226-a404-f3f954eb394a","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:8c332aaa25f38cbb8e9e61085790d9193ee17f6a6d854d40fba37fdf5a006673","observation_id":"e57183a7-40e2-4b37-981a-ad9601eefce0","resolution":{"observed_at":"2026-07-01T14:15:46.683779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.14950","last_updated":"2026-05-14T15:21:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T15:21:36Z","title":"Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:39:15.662180Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.14950"},"observation_digest":"sha256:eaeffe6004135100bfc4ba04e19597d578c6e6b54eccf9ff87924fa127da9fb6","observation_id":"a7561048-f502-4d09-aaf8-2992e5b5d62a","resolution":{"observed_at":"2026-07-01T14:25:46.196481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2606.02274","last_updated":"2026-06-06T05:27:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T14:01:11Z","title":"Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T14:41:50.084254Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2606.02274"},"observation_digest":"sha256:090446bb38aa4e5d2881905b32113010a91d60439478eb4133ba89fd66b9c15f","observation_id":"d484f26f-42dd-4851-aad3-6662d8f9ab1b","resolution":{"observed_at":"2026-07-01T23:06:20.378897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2606.10862","last_updated":"2026-06-09T13:39:49Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:39:49Z","title":"LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T13:47:28.832078Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2606.10862"},"observation_digest":"sha256:b67e1a44cf270c5d0f2850daea4a168e56f63a4914ad599762e2bf6ae4df7399","observation_id":"a7e3c69d-5d32-4bf0-8d84-b30f4260f15e","resolution":{"observed_at":"2026-07-03T04:37:37.072871Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2606.29384","last_updated":"2026-06-28T13:19:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-28T13:19:11Z","title":"Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T07:01:48.330369Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2606.29384"},"observation_digest":"sha256:a441f1d6c0ac73d325dc7d93f567668223768fb8454c7b8cd7805c2c169d20fa","observation_id":"b1ebb169-2504-4e9d-ba44-7e4680adbf17","resolution":{"observed_at":"2026-06-30T07:04:21.054350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2607.05396","last_updated":"2026-07-06T17:59:59Z","snapshot_observed_at":"2026-07-09T23:18:26.152841Z","submitted_at":"2026-07-06T17:59:59Z","title":"From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-07T12:28:21.318505Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2607.05396"},"observation_digest":"sha256:2a13eae58f06539717c0e72748c1e94a63d11619aa4bb99f2743114d90a23533","observation_id":"edf36261-3759-4659-977e-f093520ed7b4","resolution":{"observed_at":"2026-07-07T12:33:45.454775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-08-06T20:19:48.331513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-09T17:15:55.928560Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.331513Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:352428b8e5aea93dea2feb024aeb26e99505bb59aeac212d439139998d2da711","observation_id":"752060ec-438d-4d3c-ad9e-06c242fde276","resolution":{"observed_at":"2026-08-06T20:19:48.331513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.21970/citation-record","integrity":"/paper/2512.21970/integrity","json":"/paper/2512.21970/citation-record.json","paper":"/paper/2512.21970"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-03T14:00:20.737775Z","title":"Paligemma: A versatile 3b vlm for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.737775Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:bcbdf2413813922939412c491c0f9113979a7c50e5f8df91c22409dc8b824ba0","observation_id":"46c1f415-e2de-4090-84b6-4c84f4b9f9bc","resolution":{"observed_at":"2026-08-03T14:00:20.737775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T14:00:20.741580Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.741580Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:f653930e282a7b0b5f5fd8196cb1d0a05dc04a85f39efe049089f8444e4102fd","observation_id":"f57f7164-e780-41dd-b100-7eae2098dd6f","resolution":{"observed_at":"2026-08-03T14:00:20.741580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T14:00:20.744666Z","title":"Open- vla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.744666Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:0cbc868cbb53332835b7bec5b508f3d5f610cdfb9ecf17763798ae18793bdd87","observation_id":"fc92c517-4865-4452-bc7b-95c19d52efc7","resolution":{"observed_at":"2026-08-03T14:00:20.744666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T14:00:20.747597Z","title":"π0. 5: a vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.747597Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:30c7a6ca910aea8c15fa0cf8c868a63bb444bb3311461bf0e1b58e3905c2c38a","observation_id":"ba07debc-8ef5-439a-8209-c1b2b6bdb2a3","resolution":{"observed_at":"2026-08-03T14:00:20.747597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-03T14:00:20.750637Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.750637Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:0a2abfd33991d8342e13ca0fa55337b97cce85a3f3db0a5c2d1c3bfdd25d2abd","observation_id":"f730debf-8187-427d-967b-d0a5525fe6cd","resolution":{"observed_at":"2026-08-03T14:00:20.750637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-03T14:00:20.753591Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.753591Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:d256c8873dcafccef816e52bfffa2a8f06e1185106881c213c51169a9626957e","observation_id":"6825f712-3351-4e25-aa62-63d2296ebe0f","resolution":{"observed_at":"2026-08-03T14:00:20.753591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.756756Z","title":"Rvt: Robotic view transformer for 3d object manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.756756Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:55f6ef6dac5e2c7be3bfc1e8e747d517f0ef7de9c2cb2bd9b55d8492c8e7c69a","observation_id":"03fd8ee7-6853-4824-ae1f-c8df13e08116","resolution":{"observed_at":"2026-08-03T14:00:20.756756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-03T14:00:20.759135Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.759135Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:4221f660cfb4eaef8a195cdabc5b11d03f3a1f59d001338f42471f5f12e7a791","observation_id":"662f0ae5-f798-498d-9708-7c14a6018916","resolution":{"observed_at":"2026-08-03T14:00:20.759135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-03T14:00:20.761836Z","title":"Graspvla: a grasping foundation model pre-trained on billion-scale synthetic action data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.761836Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:e89ca8f602f0195f41b976072c160603398b07dbbc4665868ec582e5f86a5129","observation_id":"d0453c9e-7fcb-4835-9a80-0b48797b0afe","resolution":{"observed_at":"2026-08-03T14:00:20.761836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03659","last_updated":"2023-07-07T15:26:03Z","snapshot_observed_at":"2026-07-06T15:51:31.792957Z","submitted_at":"2023-07-07T15:26:03Z","title":"Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03659","snapshot_observed_at":"2026-08-03T14:00:20.764446Z","title":"Decomposing the generalization gap in imitation learning for visual robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.764446Z"},"links":{"cited_paper":"/paper/2307.03659","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:613772f6ee46e4509cd132c865cd0f4e2f11eee811e943efaaad1cb5038b5604","observation_id":"6c12eae7-0785-4216-8443-8ed0825365d4","resolution":{"observed_at":"2026-08-03T14:00:20.764446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-03T14:00:20.767550Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.767550Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a6c2f9650440ef0ad133d0c90986969972428a3d721a33fef3834560e2d6e7fc","observation_id":"6e4c4c3a-4b9b-426e-968a-47eabbdc959b","resolution":{"observed_at":"2026-08-03T14:00:20.767550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.770358Z","title":"Foundationstereo: Zero-shot stereo matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.770358Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9229b07b087e3be3ef9e76444d527a0d311ac3b631db3d9a556f1c99a3c04a58","observation_id":"181423dd-04dc-410a-99c6-a4bc3b9677ba","resolution":{"observed_at":"2026-08-03T14:00:20.770358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.772653Z","title":"Prismatic vlms: Investigating the design space of visually- conditioned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.772653Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:7a5070d3e04e3cc1559f21a975d09d1faa307fa2eecdae6686b9a79605cf5b81","observation_id":"554549d3-8d71-4939-8218-cd4de7077f43","resolution":{"observed_at":"2026-08-03T14:00:20.772653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.775125Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.775125Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:f4eeecc38323222669054edc2a0ff5d17f688279c5cc771e90eb4509b43e9cfa","observation_id":"39029919-013e-4d46-853b-efa44f1a2299","resolution":{"observed_at":"2026-08-03T14:00:20.775125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16858","last_updated":"2024-06-30T15:03:25Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:11Z","title":"EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16858","snapshot_observed_at":"2026-08-03T14:00:20.777481Z","title":"Eagle-2: Faster infer- ence of language models with dynamic draft trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.777481Z"},"links":{"cited_paper":"/paper/2406.16858","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:0fe486c42c8081302018036de79f56d5c2be473ddfad6eee099123760787837b","observation_id":"4f73e351-04a5-481c-834b-d809dec0f86a","resolution":{"observed_at":"2026-08-03T14:00:20.777481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T14:00:20.780838Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.780838Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:8b1aa09d05cc86efe8ac6cf44ad1904f93de64ff6060779ea95acc0791ecd083","observation_id":"b43e69d0-a3c6-4f6e-aa8b-bb178e9ae143","resolution":{"observed_at":"2026-08-03T14:00:20.780838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.784051Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.784051Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:cde489eee5d43d9d2330469174e93fbba4ffcd297447dbd6bd92e754d073b18f","observation_id":"3a851f77-53a9-486b-bb2e-7e3a89c5e85a","resolution":{"observed_at":"2026-08-03T14:00:20.784051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-03T14:00:20.788875Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.788875Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:0934cddaf52c69c02e7bf4485fa0aa99d705bec28128a95cf249778f53ffbd4b","observation_id":"382014e7-f9dc-47f3-9831-1d1944bc0ead","resolution":{"observed_at":"2026-08-03T14:00:20.788875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-03T14:00:20.791509Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.791509Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:1247e05db019051d384c169dc15b1fa0dae9a861f8bef3ad0f3ae3486a6350a8","observation_id":"44ed9fe0-4171-4711-b7d2-4fd74768c3e7","resolution":{"observed_at":"2026-08-03T14:00:20.791509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-03T14:00:20.794026Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.794026Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:1be094c5d0b1e5634ec3b0bc6d12e810fe119e624a7bf9003278f841e1cede9c","observation_id":"fea9d4a4-1c36-40ec-9b5f-a6275e93d73d","resolution":{"observed_at":"2026-08-03T14:00:20.794026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.796749Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.796749Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:1eb5cc75cd6e71a11120716cafd1d6f5dfccae50370bf416584dd605d4a51101","observation_id":"eca535a6-128e-4486-811c-d410d44d37d1","resolution":{"observed_at":"2026-08-03T14:00:20.796749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T14:00:20.799400Z","title":"pi0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.799400Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:85c7da921a57a7043f4527b69f5531fcdca772354b7b8aa85b08faf4327bad56","observation_id":"f056f3fc-099d-46af-bbbc-0f95a73d027b","resolution":{"observed_at":"2026-08-03T14:00:20.799400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T14:00:20.802389Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.802389Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:930b1cc956118a7da71ff33985a386c1b3e4591a15506812e232d005578eaac8","observation_id":"a8884fcb-8c89-4f58-b5b6-ee2dd654999b","resolution":{"observed_at":"2026-08-03T14:00:20.802389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-03T14:00:20.804995Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.804995Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:77be36e2689f68cb45bcae0ca1e8568689afc078f261a08c80abe61559192602","observation_id":"6fbd01ba-5fc9-444c-8fa7-850c96c17140","resolution":{"observed_at":"2026-08-03T14:00:20.804995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-03T14:00:20.807558Z","title":"Hybridvla: Collaborative diffusion and au- toregression in a unified vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.807558Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:6d09dbe2a841a2704042d9c3b30e9c240ce56fa56463f6c03283513fa3428845","observation_id":"b00390d9-18ec-48ce-a580-866cfea3d4fd","resolution":{"observed_at":"2026-08-03T14:00:20.807558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-03T14:00:20.810263Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.810263Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a4427fef719e340cb39dd9a931bfdb5494b91df60cba6c0f4a85a96b85b35044","observation_id":"97dccf5f-d256-472f-b89a-48a53538c6ff","resolution":{"observed_at":"2026-08-03T14:00:20.810263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.812858Z","title":"Internvla-m1: Latent spatial grounding for instruction-following robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.812858Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:f01c2ecd0fe0a3b4901c1fe001cac9bc31fc47101d9976a8b23ff2c26f399ef0","observation_id":"f0450714-5eae-4d4f-8f1f-276e0e82d94a","resolution":{"observed_at":"2026-08-03T14:00:20.812858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.815149Z","title":"Tinyvla: Toward fast, data-efficient vision-language-action models for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.815149Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:28349089ad723147b5dd3c8ef1fb575e0852723edf758facb9f55c14df0e5f85","observation_id":"bd8ee129-bbb4-4602-bcb2-e0b2d8c276ad","resolution":{"observed_at":"2026-08-03T14:00:20.815149Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-03T14:00:20.817485Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.817485Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:db65754de789ed95919b1a7fd25fd1f0066ce5ed2ebeb15a7d124fae04dc3dc8","observation_id":"0c17244c-5f64-4dec-9b5d-a7bd080a0504","resolution":{"observed_at":"2026-08-03T14:00:20.817485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-05T12:04:21.579432Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-03T14:00:20.820085Z","title":"Generalizable humanoid manipulation with 3d diffusion policies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.820085Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9179ee8de6c1c6ad9697e17cc5c21e39561d477e891dfdb78dbf0dc77bb89bb1","observation_id":"fbe30e33-4bb9-4f8f-a2f5-80d8c2b5d870","resolution":{"observed_at":"2026-08-03T14:00:20.820085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-03T14:00:20.822651Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.822651Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:e67443bdf0453584a2e00aa52919b85a794d9c5c77314c727950f18426eddfa4","observation_id":"60ae4b1e-e783-49a8-8fe4-ca8fa6d8090e","resolution":{"observed_at":"2026-08-03T14:00:20.822651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-03T14:00:20.825243Z","title":"Pointvla: Injecting the 3d world into vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.825243Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2c6b6267c1ff2d5e97408b4f5244378c27d833cc91187554fecd0809823a7b7f","observation_id":"68888964-eab6-4441-904e-4ebba7a9d12e","resolution":{"observed_at":"2026-08-03T14:00:20.825243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.827780Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.827780Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:07c81a4f3557c00491e07f76e7ccd6707ae0e22e56f2eb1f15672bca4a6712bd","observation_id":"3f516bb1-7f71-487f-a83a-b3ad062311da","resolution":{"observed_at":"2026-08-03T14:00:20.827780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08950","last_updated":"2025-03-11T23:01:08Z","snapshot_observed_at":"2026-08-07T17:11:34.321061Z","submitted_at":"2025-03-11T23:01:08Z","title":"FP3: A 3D Foundation Policy for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08950","snapshot_observed_at":"2026-08-03T14:00:20.830245Z","title":"Fp3: A 3d foundation policy for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.830245Z"},"links":{"cited_paper":"/paper/2503.08950","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:be2d2cbf07839061506f230cdc7dfe0f80878570cc91a483bde02daa72bd0a58","observation_id":"08b01426-c2c5-4119-a374-e7fc6457bbae","resolution":{"observed_at":"2026-08-03T14:00:20.830245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.832873Z","title":"Evo-0: Vision- language-action model with implicit spatial understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.832873Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:93585c6763d6342514889e97ab318bbf482547d6d4670d09974a89b516caa009","observation_id":"f3e85bbd-a1e7-4674-b97b-17ba4355c0ab","resolution":{"observed_at":"2026-08-03T14:00:20.832873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.835316Z","title":"Gp3: A 3d geometry-aware policy with multi-view images for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.835316Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:feffa159b3375a42a039460ebb0f2f0755c74dd3ee578c194833078de2759894","observation_id":"4b14c6b1-069a-4c3f-8d63-d0608475797d","resolution":{"observed_at":"2026-08-03T14:00:20.835316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.837678Z","title":"Learning the distribution of er- rors in stereo matching for joint disparity and uncertainty estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.837678Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:c8421ba669a7dec7b0c17b26e244993b992287762e40596db006fde7201ab700","observation_id":"647f1a5d-5aac-435e-a2c3-c5b1b0cdfba5","resolution":{"observed_at":"2026-08-03T14:00:20.837678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.840251Z","title":"Cfnet: Cascade and fused cost volume for robust stereo matching,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.840251Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a372e5ff99fed14c1105ed714e3efd65481e9afc24c7e3af3109e13e53f4eca8","observation_id":"f295d6cf-0cf1-4c91-9e22-e1c45540f400","resolution":{"observed_at":"2026-08-03T14:00:20.840251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.842621Z","title":"Pcw-net: Pyramid combination and warping cost volume for stereo matching,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.842621Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:3c567f6cf13cb9530fc89aaa57a1c807d6a6122fb6f862293a9e6cdf503f5a93","observation_id":"af5d338b-0d2c-4dde-94ff-729c23ab1b40","resolution":{"observed_at":"2026-08-03T14:00:20.842621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.845047Z","title":"Aanet: Adaptive aggregation network for efficient stereo matching,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.845047Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:221ab501e52515997675d5f84616665c0648c1a1ade4d11d7498d07bf4c6c318","observation_id":"0be59683-b8ed-47d8-b656-0a7af496d967","resolution":{"observed_at":"2026-08-03T14:00:20.845047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.847397Z","title":"Arunet: Advancing real-time stereo matching for robotic perception on edge devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.847397Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:fd6d6f7a59b4d5aa06f32dcd2c6c4ef90189d47f6f9273683ebccd4d4e093166","observation_id":"689ded80-bfb5-4e9a-83a1-2fbaaed4be91","resolution":{"observed_at":"2026-08-03T14:00:20.847397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.849923Z","title":"Gfanet: Group fusion aggregation network for real time stereo matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.849923Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:3caa5981fd324ab9985de4dde1b1e5d353ade51e50da4d6f100d42e201623c66","observation_id":"e4f029ab-af3e-4d83-b1b9-4943b8887eac","resolution":{"observed_at":"2026-08-03T14:00:20.849923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.852639Z","title":"Raft-stereo: Multilevel recurrent field transforms for stereo matching,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.852639Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:229d63392290ccb1233ae91b7c65948a140335e698463b7ed1f52c84ef50e4bf","observation_id":"40a17586-476b-42e5-9d95-d701b592fa3d","resolution":{"observed_at":"2026-08-03T14:00:20.852639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.855173Z","title":"Iterative geometry encoding volume for stereo matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.855173Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2241fe8ac38d3b43a0f4af4f8b94523e8aaf5ea401f84af8069e74fe44d3de02","observation_id":"b657e44e-d0cd-407a-8b97-780df2ec3e1d","resolution":{"observed_at":"2026-08-03T14:00:20.855173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.857433Z","title":"Practical stereo matching via cascaded recurrent network with adaptive correlation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.857433Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:d249f593644891bb42de397643ccd3118a299c65877773ccfc914eacdb83e021","observation_id":"821d3cfa-00e1-47ac-85f8-27b550f0867b","resolution":{"observed_at":"2026-08-03T14:00:20.857433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.859742Z","title":"Uncertainty guided adaptive warping for robust and efficient stereo matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.859742Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2c171c84bb865e892e747e58e540219e8af428abaacb2052bd9eedee90bfefb3","observation_id":"9cb26f67-0881-472b-849d-e25512166d71","resolution":{"observed_at":"2026-08-03T14:00:20.859742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.862334Z","title":"Learning intra- view and cross-view geometric knowledge for stereo matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.862334Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:76eb4a83f5d7dbb56a3770a3bae9d3fb936573a4b0240a50b8d3b74e6fa26e7e","observation_id":"f7d67585-2b8e-409a-8f2f-255dc443fb49","resolution":{"observed_at":"2026-08-03T14:00:20.862334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.864728Z","title":"Efficient and hardware-friendly online adaptation for deep stereo depth estimation on embedded robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.864728Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:39c5234898e6a80d61c24cf6a136a8a2d404ed2a03152c7b68f7d503712d34c1","observation_id":"536476e5-9dc8-4179-ac95-322f49b11667","resolution":{"observed_at":"2026-08-03T14:00:20.864728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.867054Z","title":"Stereo image- based visual servoing towards feature-based grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.867054Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2137e673e874db361edd740ec994549fc26a922a2294163c8239be75f7d7b172","observation_id":"68fd4d0a-e8fc-4911-b6fa-302c7204bdc8","resolution":{"observed_at":"2026-08-03T14:00:20.867054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01791","last_updated":"2025-02-01T07:58:23Z","snapshot_observed_at":"2026-08-10T16:30:50.233061Z","submitted_at":"2024-11-27T23:15:06Z","title":"DextrAH-RGB: Visuomotor Policies to Grasp Anything with Dexterous Hands","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01791","snapshot_observed_at":"2026-08-03T14:00:20.869541Z","title":"Dextrah- rgb: Visuomotor policies to grasp anything with dexterous hands,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.869541Z"},"links":{"cited_paper":"/paper/2412.01791","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:caaa7e32531047a8f6d21b9f87335e57d2f8ee9d1c6b734be330c0a55bf1189f","observation_id":"6c24e98b-43b4-43c6-a2d6-b31742e32627","resolution":{"observed_at":"2026-08-03T14:00:20.869541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.872190Z","title":"Simnet: Enabling robust unknown object manipulation from pure synthetic data via stereo,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.872190Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:4a20bc302c19c68ff2f08f61af5928fe87ed072bfc34af9ac38c248957decfb7","observation_id":"52159cb6-e386-4419-bbfb-962ed03dc739","resolution":{"observed_at":"2026-08-03T14:00:20.872190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-03T14:00:20.874567Z","title":"Internlm2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.874567Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a87f3df1084779d0b2d2381b50ec820319bdf49dcc7635fee663fd7400e33915","observation_id":"183fd8e0-b25a-4fcc-a077-b286aba51e48","resolution":{"observed_at":"2026-08-03T14:00:20.874567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T14:00:20.877040Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.877040Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:8b3df6158f24da817b69aa7c6a9cf02712c4617c55c62a584155d4bf7c408938","observation_id":"9a010d3a-800f-4e66-b2ae-51f5b95e2bb2","resolution":{"observed_at":"2026-08-03T14:00:20.877040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T14:00:20.879627Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.879627Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:bd4f7ab0ea4f0aeb7573261ef65991afa12362725dfc399b35be7d781ba8ed27","observation_id":"c60bafb7-2202-42ce-a5fd-18448b6c4d0f","resolution":{"observed_at":"2026-08-03T14:00:20.879627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.882762Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.882762Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:6b778a9dfa88e9dcd475fde437304ceee1ae9d49ba14c0415c0a3649baa39dfe","observation_id":"08702300-1375-4a36-89de-93277c83f09b","resolution":{"observed_at":"2026-08-03T14:00:20.882762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.885441Z","title":"Mujoco: A physics engine for model-based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.885441Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:c08fe63013f5955809a45468ad30684ae7c959b425567a6f3cf4d6caa35d3e52","observation_id":"c7b73b3f-2007-4ada-b7e0-853868a86f79","resolution":{"observed_at":"2026-08-03T14:00:20.885441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.888280Z","title":"Isaac Sim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.888280Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:5e5d8e763e884d932091f2cb3cd8a8a67ca931b9b1d1db1c22f699c849395adc","observation_id":"a3143be9-2046-47ad-8b82-d46d4be7beb8","resolution":{"observed_at":"2026-08-03T14:00:20.888280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-03T14:00:20.891559Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.891559Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:d7494ebc5ba38060fa16215214b51493d6df32cf6e0321fb60d68f73cc4ca78d","observation_id":"bd27a75e-e7af-41b7-9a7c-8dc80099b7c9","resolution":{"observed_at":"2026-08-03T14:00:20.891559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.894490Z","title":"Vggt: Visual geometry grounded transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.894490Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:085abfdb4a0876d57d4a0a255f568ede13f543173cdb0e0b45d6e070e4f08537","observation_id":"bf7fb575-bf4f-4a41-918c-8fbd10c5ec33","resolution":{"observed_at":"2026-08-03T14:00:20.894490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.896966Z","title":"Depth map prediction from a single image using a multi-scale deep network,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.896966Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:7b5a41ce0945867534dd10b079fe1d2e3c1624f0f0dff3be9e651c06e05e4a45","observation_id":"0f44e8f0-4a64-4c6a-b38c-f743f13a6696","resolution":{"observed_at":"2026-08-03T14:00:20.896966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T14:32:36.802062Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 11 inbound Pith citation observations for arXiv:2512.21970."}