{"as_of":"2026-08-10T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88fb12f261b1ba1b0e92207a323bae2bde2acf1ed63cefa16907cc2510b4e8a0","coverage":[{"denominator":166,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:31:04.674245Z","state":"measured"},{"denominator":114,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":114,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:39:02.315303Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T11:41:02.543365Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-06T12:39:02.315303Z","title":"A survey on vision-language- action models for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21610","last_updated":"2025-08-16T15:20:38Z","snapshot_observed_at":"2026-08-09T11:29:14.988543Z","submitted_at":"2025-07-29T09:06:40Z","title":"Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:02.315303Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2507.21610"},"observation_digest":"sha256:065f4e7d05a51f8e7a270c5ba0ef05de83d997c2163d4aa631b4ae5c2e15ae94","observation_id":"6114a5cf-459a-4563-b467-772dcb481c99","resolution":{"observed_at":"2026-08-06T12:39:02.315303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-04T09:08:07.066489Z","title":"A survey on vision-language-action models for autonomous driving.arXiv preprint arXiv:2506.24044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:07.066489Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:2f8a639b2bbf9f79cabccda797a0ac70d8e236aed348da176db81d51cff9cc67","observation_id":"0538d1b4-ec46-4733-ba7d-7fb55c70bcfc","resolution":{"observed_at":"2026-08-04T09:08:07.066489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T18:37:03.416823Z","title":"A survey on vision-language- action models for autonomous driving.arXiv preprint arXiv:2506.24044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-08T23:42:48.543241Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.416823Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:6b64683f0877df243cba89f73d3be93308bd6af33cf214a1dc53230c67f4543b","observation_id":"92d6ba2c-4203-42ed-9441-008dca2c40cc","resolution":{"observed_at":"2026-08-03T18:37:03.416823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T17:38:20.749342Z","title":"A survey on vision-language-action models for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-03T17:38:18.677599Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.749342Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:1fd2357d2adff969344c30531bb6346eb03ed5fff66279a92da3186244587c89","observation_id":"3ac9cf36-3282-43d6-9301-f54beba24238","resolution":{"observed_at":"2026-08-03T17:38:20.749342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T16:52:52.413571Z","title":"arXiv preprint arXiv:2506.24044","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-03T16:52:46.785804Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:52.413571Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:b5b609aa06373ad6650fc707b9c0687a666cf3b51d180a4e389fbc6082c25fbf","observation_id":"ac0e4079-2379-48f1-aae3-20bfad6b6af6","resolution":{"observed_at":"2026-08-03T16:52:52.413571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2601.01322","last_updated":"2026-05-03T05:35:23Z","snapshot_observed_at":"2026-08-02T23:32:22.443147Z","submitted_at":"2026-01-04T01:17:36Z","title":"LinMU: Multimodal Understanding Made Linear","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T18:32:23.951566Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2601.01322"},"observation_digest":"sha256:2d8fb0a9681029efeb1993eb7472675506f437ba01c2ce7797744a84bf78859f","observation_id":"0b1d1384-657a-4d9f-b8a6-c3c5f9bd6585","resolution":{"observed_at":"2026-05-16T18:33:15.213150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-04T06:07:09.468768Z","title":"Tian, X., Gu, J., Li, B., Liu, Y ., Wang, Y ., Zhao, Z., Zhan, K., Jia, P., Lang, X., and Zhao, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10719","last_updated":"2026-08-01T13:11:04Z","snapshot_observed_at":"2026-08-09T15:16:22.170091Z","submitted_at":"2026-02-11T10:25:05Z","title":"From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:09.468768Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2602.10719"},"observation_digest":"sha256:74e3476332f890a7aa837a5059d646ad8343368f7c7e1d248a129e3c0beedf93","observation_id":"04c9f689-ac34-47c7-a01d-e8440510b18d","resolution":{"observed_at":"2026-08-04T06:07:09.468768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:e25d80ecae0c904ae3f928baea16608bf8042ffbb347eb66a18994265b117af9","observation_id":"136b991e-d88f-48a0-9c4b-a5d941be43f3","resolution":{"observed_at":"2026-07-05T11:41:02.544826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:9fb5e4fce72ae14f04150570535c5f53b3705a1678fd4590a46dc08d0d8ea7f2","observation_id":"85266423-3b9a-482c-b212-fadb1dfcaf91","resolution":{"observed_at":"2026-05-10T05:51:10.420760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2604.22851","last_updated":"2026-07-07T12:47:51Z","snapshot_observed_at":"2026-07-12T18:45:30.417168Z","submitted_at":"2026-04-22T07:49:02Z","title":"EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T00:09:18.068337Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2604.22851"},"observation_digest":"sha256:58892923157501189d58354a11dc7c941082694c50c681345675a37dbb5c20cf","observation_id":"24670dd2-623b-4306-9a19-12df51202285","resolution":{"observed_at":"2026-05-10T00:19:47.159530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:46.145616Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:d3f13b8b85a85331a641af84cac40bfed3cef2039ac6004bf128ad2b14596d83","observation_id":"670b3c2b-9aab-4827-bfd5-e0b330b9271c","resolution":{"observed_at":"2026-06-29T18:23:51.152734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T21:35:33.280591Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:28a44fdfc9c6020e17276c37016b4cc163258c28dcbbcde23399ac237377e6b4","observation_id":"3158c713-bf1e-40eb-aa7b-8f6b7f88b616","resolution":{"observed_at":"2026-07-02T21:37:24.180527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-07-05T11:41:02.543365Z","title":"A survey on vision-language-action models for autonomous driving","venue":"cs.CV","work_id":"fa453719-6e33-44d4-b9e2-079189a05401","year":2025},"citing_paper":{"arxiv_id":"2606.31830","last_updated":"2026-06-30T15:36:48Z","snapshot_observed_at":"2026-08-03T02:38:11.037610Z","submitted_at":"2026-06-30T15:36:48Z","title":"PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T05:58:58.075150Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2606.31830"},"observation_digest":"sha256:5db6f81d67c43343add823272738da458493d2834be875b019d1b94e9756ddab","observation_id":"0d0865d9-586c-436c-b941-718cebd07d84","resolution":{"observed_at":"2026-07-01T09:55:41.492322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-04T07:11:20.776007Z","title":"A survey on vision-language-action models for au- tonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02449","last_updated":"2026-08-03T16:24:17Z","snapshot_observed_at":"2026-08-07T14:34:04.648212Z","submitted_at":"2026-08-03T16:24:17Z","title":"MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T07:11:20.776007Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2608.02449"},"observation_digest":"sha256:3def242533dff224bc12c103fd2f1f462b04699a7621e968de79523a6ab8e8e0","observation_id":"8c159a26-866d-4ccf-a534-b4e5dccdc3dc","resolution":{"observed_at":"2026-08-04T07:11:20.776007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.24044/citation-record","integrity":"/paper/2506.24044/integrity","json":"/paper/2506.24044/citation-record.json","paper":"/paper/2506.24044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.317875Z","title":"Flamingo: a visual language model for few-shot learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.317875Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a97dc38ac8d500725d71329840259a66c958fae92748a27512bc452a173ee1f2","observation_id":"95972b4e-af7f-4426-b799-a6a82ba1c909","resolution":{"observed_at":"2026-08-06T21:31:04.317875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.321970Z","title":"An lstm net- work for highway trajectory prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.321970Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e002cf97f89fd9e9a6c714eeb98e6009729a3ade42b9717a1337ccdf746360cb","observation_id":"9683c8e4-9fa6-4ba5-b4de-b343ce145803","resolution":{"observed_at":"2026-08-06T21:31:04.321970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15672","last_updated":"2025-02-21T18:56:02Z","snapshot_observed_at":"2026-08-07T17:57:44.152083Z","submitted_at":"2025-02-21T18:56:02Z","title":"VaViM and VaVAM: Autonomous Driving through Video Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15672","snapshot_observed_at":"2026-08-06T21:31:04.325481Z","title":"Vavim and vavam: Autonomous driving through video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.325481Z"},"links":{"cited_paper":"/paper/2502.15672","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:6f9629401716ab9a3b2a45e1a825ceeb8010fb771f31284371af369ccb8f7a19","observation_id":"1d2f59fb-38cf-4392-b6ad-e788b6dbb978","resolution":{"observed_at":"2026-08-06T21:31:04.325481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T21:31:04.329364Z","title":"pi0: A vision-language- action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.329364Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:333f6baf359db46e2286a55b6d97c909d040997637d61cc8f05b311768a51cb1","observation_id":"3be9daf3-30aa-47f2-8f53-03ea0dfa3524","resolution":{"observed_at":"2026-08-06T21:31:04.329364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.333208Z","title":"Fine-grained affective processing capabilities emerging from large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.333208Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:71dc962606d5bf9811ea40b6db1f2aa5bfcb0f82a4617ddb15624aca0b0ae83c","observation_id":"a940b45e-a0dc-4940-be05-64a3d59804c0","resolution":{"observed_at":"2026-08-06T21:31:04.333208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.336827Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.336827Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:85d37cb5b7b90d6a34837c9f9ed278e9f307531c68a339b11132893fd3b26453","observation_id":"0c255595-3398-4239-bed9-78afb5ad81ef","resolution":{"observed_at":"2026-08-06T21:31:04.336827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.341206Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.341206Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:4d7f20100ce26ff2eae2d75ab1c1c4dadb31cac7c1bdb33dc74a26979eae7d76","observation_id":"eddffb62-ec8c-4c99-9782-f80d4cdc0146","resolution":{"observed_at":"2026-08-06T21:31:04.341206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.344745Z","title":"nuscenes: A mul- timodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.344745Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:cce2b413f9eee82bc348e260b2f687003d0be1d0e52ad33f05520996e50c8ff8","observation_id":"7fa2c5dd-9bfd-4e66-9c0b-c682eeeca2fa","resolution":{"observed_at":"2026-08-06T21:31:04.344745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.349406Z","title":"Learning from all vehi- cles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.349406Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:3a662c7084b53fb870ac9faa080a76bb0efa31934556c4a9925eca66c386edeb","observation_id":"87ae5ca0-c84f-4946-9287-e7bf4952b552","resolution":{"observed_at":"2026-08-06T21:31:04.349406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.352905Z","title":"Insight: Enhancing autonomous driving safety through vision-language models on context-aware hazard detection and edge case evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.352905Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:788a2525f90a150f7a64ff8912e8069e7cd27eac15dd672823bb5ff4c5ca0b33","observation_id":"15618d1e-cae1-4536-a0a4-4ad30489a0fb","resolution":{"observed_at":"2026-08-06T21:31:04.352905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12670","last_updated":"2025-05-19T03:37:15Z","snapshot_observed_at":"2026-08-07T15:43:31.571198Z","submitted_at":"2025-05-19T03:37:15Z","title":"TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12670","snapshot_observed_at":"2026-08-06T21:31:04.357239Z","title":"Ts- vlm: Text-guided softsort pooling for vision-language models in multi-view driving reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.357239Z"},"links":{"cited_paper":"/paper/2505.12670","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:4ee3c055eb89243ff5a8418decc8365da4821e9e948a16164ef7a093bd495fdc","observation_id":"88023e48-d173-4a4c-a9d3-d4966c1b92f8","resolution":{"observed_at":"2026-08-06T21:31:04.357239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.361431Z","title":"What data do we need for training an av motion planner? In 2021 IEEE Inter- national Conference on Robotics and Automation (ICRA) , pages 1066–1072","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.361431Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d69b62d795f25a0d776177179223ef36f821561d3b60cb295ce82607f40d44aa","observation_id":"4e41fc49-42a9-42da-9ee8-3ce930c479e6","resolution":{"observed_at":"2026-08-06T21:31:04.361431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.364887Z","title":"End-to-end autonomous driving: Challenges and frontiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.364887Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9d100a5cd32e5ea2950fda186ef66e71450adaf11cc1da20c1b0fa8ec165c5fc","observation_id":"b5cd6e6b-7abf-4712-a9a2-783a5470fee6","resolution":{"observed_at":"2026-08-06T21:31:04.364887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-06T21:31:04.369131Z","title":"Vadv2: End-to-end vectorized au- tonomous driving via probabilistic planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.369131Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b20f3484cb9cf2cb8c1e22fd5f796d20f75ac2927b5fd8533f52ec36d8ddd920","observation_id":"f48e424e-dd98-4372-b145-c8ce827bcbc7","resolution":{"observed_at":"2026-08-06T21:31:04.369131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.373472Z","title":"Asynchronous large language model en- hanced planner for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.373472Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:19e05fb8f5080e8185156b51638a008c0c53d2fcb58f6137802527386b245d07","observation_id":"1d70c450-28a6-4dcc-8af5-14c10c1389aa","resolution":{"observed_at":"2026-08-06T21:31:04.373472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.377211Z","title":"Ppad: Iterative interactions of prediction and planning for end-to-end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.377211Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b6eb4cd148d5e8bdd72397e2a5fe99a9eb68e6bb2b1edd70bf24a165222fdad9","observation_id":"206166b7-1c33-4c8c-971f-57f8bf472cfb","resolution":{"observed_at":"2026-08-06T21:31:04.377211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.381473Z","title":"CoVLA: Comprehensive vision-language-action dataset for au- tonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.381473Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e0e18ef04ba6e580090c7db42eaf350f5b6adce474a113c1adc26e83c1457ab4","observation_id":"981fc864-c778-4305-a2b6-26039998b808","resolution":{"observed_at":"2026-08-06T21:31:04.381473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-07T14:05:09.038917Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-06T21:31:04.384791Z","title":"Impromptu vla: Open weights and open data for driving vision- language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.384791Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:48183cfe5c3d22d4144f8ad32fa527793e655ed161c693f1d4645bebc6aadd40","observation_id":"ae9035c8-cebe-40f7-8752-3275413763fa","resolution":{"observed_at":"2026-08-06T21:31:04.384791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.388971Z","title":"Neat: Neural attention fields for end-to-end autonomous driving","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.388971Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b6ab8eb6e773b4dacac4fbfcf8796a70a9973ae48e8e37dd034975bc34960965","observation_id":"f0a55e4d-3b65-4899-9f39-c0b41d12bc6b","resolution":{"observed_at":"2026-08-06T21:31:04.388971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.392370Z","title":"Transfuser: Imita- tion with transformer-based sensor fusion for autonomous driving","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.392370Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:8d5e09370e9bf78a36c9dddf0f0b5fa9ded93da339ddcb2de66105560a9bf548","observation_id":"16c070ea-5acb-463f-9fea-4626f7e83d4f","resolution":{"observed_at":"2026-08-06T21:31:04.392370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.395495Z","title":"Talk2bev: Language-enhanced bird’s- eye view maps for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.395495Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:c963e9e40b444012c8262502d0a93298289280f5dad323bb91e8f423cce389d9","observation_id":"230a8c27-d8da-41f2-863a-2fe5460e25b3","resolution":{"observed_at":"2026-08-06T21:31:04.395495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.398942Z","title":"A survey on multimodal large lan- guage models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.398942Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:8bcc003b3c7a3d7ee131648ef7c9a11e30d87335d4a84b664ad77d6629d71846","observation_id":"d5233365-64c2-4c2b-9811-1693fd109563","resolution":{"observed_at":"2026-08-06T21:31:04.398942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-09T21:06:33.120007Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20223","snapshot_observed_at":"2026-08-06T21:31:04.402197Z","title":"Chain-of-thought for autonomous driving: A comprehensive survey and future prospects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.402197Z"},"links":{"cited_paper":"/paper/2505.20223","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d922e9f572a9d951e6ed1dbd549a3939496a67e66dbd17e1ded8da5bb7b172f7","observation_id":"bb544cc9-b712-435f-b5f1-ee1b4e55acd0","resolution":{"observed_at":"2026-08-06T21:31:04.402197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06702","last_updated":"2024-09-10T17:59:40Z","snapshot_observed_at":"2026-08-06T04:59:18.522033Z","submitted_at":"2024-09-10T17:59:40Z","title":"Hint-AD: Holistically Aligned Interpretability in End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06702","snapshot_observed_at":"2026-08-06T21:31:04.405773Z","title":"Hint-ad: Holistically aligned interpretability in end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.405773Z"},"links":{"cited_paper":"/paper/2409.06702","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a74dd2cf0c7274439b6bc1ae5d0efa8a50fd17db7b2d018980966bf079806ae3","observation_id":"97a7f9ab-fabd-4d1e-ba7a-1558608947d7","resolution":{"observed_at":"2026-08-06T21:31:04.405773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.409296Z","title":"Dualad: Disentangling the dynamic and static world for end-to-end driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.409296Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:19cc4349ab464bc97936d2830831eb379d31873793a35301f70610b72b42cbb0","observation_id":"400d1b16-2441-4279-a5c5-cb36963b63cf","resolution":{"observed_at":"2026-08-06T21:31:04.409296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.412510Z","title":"Carla: An open urban driv- ing simulator","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.412510Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d7bc866f0c7ad1fbef4cc17fd2505c3fc7fb10cf3f7b8d912f04270afacb635a","observation_id":"043f54c0-3ae0-49c0-b9c5-106b8097b215","resolution":{"observed_at":"2026-08-06T21:31:04.412510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.415798Z","title":"On the road to portability: Compressing end-to-end motion planner for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.415798Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:6d266d6e79cb8a83abce0a31a76afcf6ef8355508b38926cc4d2c46ab1bf5714","observation_id":"18721357-3ffb-480b-a858-92e7014b9fc1","resolution":{"observed_at":"2026-08-06T21:31:04.415798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.418970Z","title":"Polarpoint-bev: Bird-eye- view perception in polar points for explainable end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.418970Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:aaa9cd345b73f683ffad879672453403526379fffc3d216f8e6a6ffb807700da","observation_id":"bf68921b-35b3-4fb8-984d-61e1486323c8","resolution":{"observed_at":"2026-08-06T21:31:04.418970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.422092Z","title":"Drive like a human: Rethinking autonomous driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.422092Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:48d6f028db75c844ad77d3466cbf3992759679f3e62360c862176f13f2b4d6a3","observation_id":"c5da9684-8de4-4242-87fb-5b4afdb9c75e","resolution":{"observed_at":"2026-08-06T21:31:04.422092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-05T21:57:39.132989Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19755","snapshot_observed_at":"2026-08-06T21:31:04.429364Z","title":"Orion: A holis- tic end-to-end autonomous driving framework by vision- language instructed action generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.429364Z"},"links":{"cited_paper":"/paper/2503.19755","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:7c5551cfef86e3ff234dd614e5c9ed13df1f058d3c98300832e8f13faeac5a35","observation_id":"25067f8d-5942-446f-b9ee-06a64cc0550d","resolution":{"observed_at":"2026-08-06T21:31:04.429364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01105","last_updated":"2024-09-05T03:38:08Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:44:59Z","title":"A Survey for Foundation Models in Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01105","snapshot_observed_at":"2026-08-06T21:31:04.432603Z","title":"A survey for foun- dation models in autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.432603Z"},"links":{"cited_paper":"/paper/2402.01105","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f1d0f511d2b49c3d5011957890849a649e36410ad56d7f272af2b57b75d4b271","observation_id":"ff5b3305-7a88-4afd-9ab0-2fc46ae66821","resolution":{"observed_at":"2026-08-06T21:31:04.432603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13406","last_updated":"2025-04-21T02:00:43Z","snapshot_observed_at":"2026-08-07T16:01:16.299297Z","submitted_at":"2025-04-18T02:03:14Z","title":"LangCoop: Collaborative Driving with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13406","snapshot_observed_at":"2026-08-06T21:31:04.436251Z","title":"Lang- coop: Collaborative driving with language","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.436251Z"},"links":{"cited_paper":"/paper/2504.13406","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:293d75b11ab105fc8b7ba5dda5e666d4c2eddd1757b5dc2dd659bbbbf9c38a0b","observation_id":"e064c0f6-803e-497d-814f-5ec440ab0104","resolution":{"observed_at":"2026-08-06T21:31:04.436251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.439666Z","title":"A review of motion planning techniques for au- tomated vehicles","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.439666Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:09fd137112e49ad42a274574c61096f0c32f2fd25092afdd68a7c7ead1510b3e","observation_id":"a06dc6e1-527a-4ff7-84eb-a8eb02c12f7c","resolution":{"observed_at":"2026-08-06T21:31:04.439666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15111","last_updated":"2025-05-21T05:05:38Z","snapshot_observed_at":"2026-08-07T15:21:35.395398Z","submitted_at":"2025-05-21T05:05:38Z","title":"iPad: Iterative Proposal-centric End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15111","snapshot_observed_at":"2026-08-06T21:31:04.442877Z","title":"ipad: Iterative proposal-centric end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.442877Z"},"links":{"cited_paper":"/paper/2505.15111","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:c7b5f75f4f559938a19631b2d105ae8fba920920d2811543402620f4ede437b9","observation_id":"eb80006e-0204-4af8-9719-477ef2246b51","resolution":{"observed_at":"2026-08-06T21:31:04.442877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17680","last_updated":"2024-06-25T16:12:52Z","snapshot_observed_at":"2026-08-10T01:40:04.353475Z","submitted_at":"2024-06-25T16:12:52Z","title":"End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17680","snapshot_observed_at":"2026-08-06T21:31:04.446259Z","title":"End-to-end autonomous driving without costly modularization and 3d manual annotation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.446259Z"},"links":{"cited_paper":"/paper/2406.17680","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:c9ac735cea9d9e7283a73e127505c2ffed1c4847c4e109927a2a0fdb61d14346","observation_id":"f6b14606-f44c-4317-aff4-815a937b3744","resolution":{"observed_at":"2026-08-06T21:31:04.446259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13112","last_updated":"2025-05-27T14:49:49Z","snapshot_observed_at":"2026-08-07T19:50:06.597130Z","submitted_at":"2024-11-20T08:14:01Z","title":"SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13112","snapshot_observed_at":"2026-08-06T21:31:04.449729Z","title":"Drivem- llm: A benchmark for spatial understanding with multi- modal large language models in autonomous driving.arXiv preprint arXiv:2411.13112, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.449729Z"},"links":{"cited_paper":"/paper/2411.13112","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d4c2b676027e72a54715da13061b662df317fb907394243096ae902d056eee30","observation_id":"cbe35daa-af34-47e7-9f69-a5ff07a714ed","resolution":{"observed_at":"2026-08-06T21:31:04.449729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.453118Z","title":"Dme-driver: Integrating human decision logic and 3d scene perception in autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.453118Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:cdeabe06f8b00d4d4c94c10aa96e2ec3b7bb8ff4b11fe9c085fb771074322acb","observation_id":"c8a4693a-d8ac-41fc-86b0-14116f3e8d94","resolution":{"observed_at":"2026-08-06T21:31:04.453118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.456365Z","title":"Driveaction: A benchmark for exploring human-like driving decisions in vla models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.456365Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:3efe34de3a4c056a9e9b680ea0ec391c6f8d6558efc6e6910961c772657b0356","observation_id":"ed0d1377-4c9b-413f-b84e-4ff74c4aeca0","resolution":{"observed_at":"2026-08-06T21:31:04.456365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.459454Z","title":"Urban driving with conditional imitation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.459454Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:3c8cedbdac8d02281850255b7dab3c6586efeceed323f4812e73a8ae344c412c","observation_id":"625c298e-8009-4e1a-815c-aeb0cfe79849","resolution":{"observed_at":"2026-08-06T21:31:04.459454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02123","last_updated":"2025-05-04T14:13:00Z","snapshot_observed_at":"2026-08-07T15:56:37.497764Z","submitted_at":"2025-05-04T14:13:00Z","title":"DriveAgent: Multi-Agent Structured Reasoning with LLM and Multimodal Sensor Fusion for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02123","snapshot_observed_at":"2026-08-06T21:31:04.462537Z","title":"Driveagent: Multi-agent structured reasoning with llm and multimodal sensor fusion for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.462537Z"},"links":{"cited_paper":"/paper/2505.02123","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ac0377f5d3b3cd9d6d78b69d0102a3867a38b583e3cf811498825b8e787c88a8","observation_id":"49fdd285-272c-4511-a055-efdfe7f3aef7","resolution":{"observed_at":"2026-08-06T21:31:04.462537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.465990Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.465990Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:174405ea895784fe015efe0dd119fc7197cd6a3d224c885049b29a0c6bcb81fa","observation_id":"7222be9c-5737-4c26-b8fb-be9cc01874f8","resolution":{"observed_at":"2026-08-06T21:31:04.465990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.469144Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.469144Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f589c476757eee13b5512c822cd28d961350bba00b31b0d60fe8010a1a15391e","observation_id":"3b76c5c3-ee14-47a7-a98d-07ad99bca1d9","resolution":{"observed_at":"2026-08-06T21:31:04.469144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.472273Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.472273Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:bd2f22a458f2f577fafccc33d05507c60626b4684e9bb35c225bd06cd6bea5f5","observation_id":"25810685-f58b-4f16-a052-e0c8c25afd6c","resolution":{"observed_at":"2026-08-06T21:31:04.472273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.475355Z","title":"A survey on trajectory-prediction methods for autonomous driving","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.475355Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:03b4a24861b0e28febba93204d794ad550f26d4d08eb7855393c69dc40ef5ac0","observation_id":"3f37d0c4-e48d-4bbc-9443-1f08c6123840","resolution":{"observed_at":"2026-08-06T21:31:04.475355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07689","last_updated":"2025-08-07T06:38:32Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T17:27:32Z","title":"RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07689","snapshot_observed_at":"2026-08-06T21:31:04.478639Z","title":"Drivemm: All-in-one large multimodal model for au- tonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.478639Z"},"links":{"cited_paper":"/paper/2412.07689","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9d9de1e67da5ffd5546862d49a0c4e936df7f2d644ce36f338d65dde63310335","observation_id":"a181b55c-bd64-43f7-8c89-c9e8f06f9781","resolution":{"observed_at":"2026-08-06T21:31:04.478639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15544","last_updated":"2024-12-20T04:08:11Z","snapshot_observed_at":"2026-08-06T17:28:05.501969Z","submitted_at":"2024-12-20T04:08:11Z","title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15544","snapshot_observed_at":"2026-08-06T21:31:04.482447Z","title":"Vlm-rl: A unified vision language models and reinforcement learning framework for safe autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.482447Z"},"links":{"cited_paper":"/paper/2412.15544","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:3186f82b725684ff7dac48e4880edf8a7e9a57208081bfccc7788e85cfdeeae7","observation_id":"c46c8d11-f331-4e38-8b22-09967ed31c8b","resolution":{"observed_at":"2026-08-06T21:31:04.482447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-06T21:31:04.485889Z","title":"Nora: A small open-sourced generalist vision lan- guage action model for embodied tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.485889Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1ffc74d1c295c7641a291eaabbaf9e1ca8924f1d6e720a81154721c136430e9a","observation_id":"0bc08dcf-5eaf-4ec0-9951-e0c68652fccf","resolution":{"observed_at":"2026-08-06T21:31:04.485889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.489388Z","title":"Yolo-v1 to yolo-v8, the rise of yolo and its complementary nature toward digital manufacturing and industrial defect detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.489388Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:54b0e11487236577f4dab17881d6c508d50e0067a4f6bad329cf8587b03a40e6","observation_id":"569b3479-5401-4fbc-8485-2bc3187b5b8a","resolution":{"observed_at":"2026-08-06T21:31:04.489388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-06T21:31:04.492816Z","title":"Emma: End-to-end mul- timodal model for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.492816Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:5a16ef05c1f01fc1b7c84e16c7f49dbd7e53e88afc552a3a5d20dee553a6ba5a","observation_id":"5224ef4c-f19f-4cbf-b687-c2984152e145","resolution":{"observed_at":"2026-08-06T21:31:04.492816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10621","last_updated":"2025-03-13T17:59:01Z","snapshot_observed_at":"2026-08-07T17:06:11.585648Z","submitted_at":"2025-03-13T17:59:01Z","title":"DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10621","snapshot_observed_at":"2026-08-06T21:31:04.496591Z","title":"Drivelmm-o1: A step-by-step reasoning dataset and large multimodal model for driving scenario understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.496591Z"},"links":{"cited_paper":"/paper/2503.10621","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d34c47beadc473aae02a1051e255ddd4f9e2926ae65a722f80d4d5216c65628d","observation_id":"559edfd9-9390-47cf-841f-54cc8482836a","resolution":{"observed_at":"2026-08-06T21:31:04.496591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.499865Z","title":"Narrate: Versatile lan- guage architecture for optimal control in robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.499865Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d8baa62d067d128671d10c6064566a6e921a1a65ec1f8fa1301b55d0882462e4","observation_id":"aacfba20-a326-47dd-945b-f37dc9f8ee14","resolution":{"observed_at":"2026-08-06T21:31:04.499865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13549","last_updated":"2023-11-22T17:44:29Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T17:44:29Z","title":"ADriver-I: A General World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13549","snapshot_observed_at":"2026-08-06T21:31:04.503085Z","title":"Adriver-i: A general world model for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.503085Z"},"links":{"cited_paper":"/paper/2311.13549","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:076d00a56a62a7125722bf2f8ba022ef632323c4dee3a9d3132f4bfbca3c5e7e","observation_id":"d92e1b2c-cbdb-4b14-9bc7-14bf466ee07e","resolution":{"observed_at":"2026-08-06T21:31:04.503085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.506379Z","title":"Think twice be- fore driving: Towards scalable decoders for end-to-end au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.506379Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:998d3b465ac293eac023e68c462eda9c12796f716a30f29867635ba1e9c9d8f4","observation_id":"334a87f1-6670-47ce-9a9c-084f0356cfd2","resolution":{"observed_at":"2026-08-06T21:31:04.506379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03877","last_updated":"2024-11-27T09:31:04Z","snapshot_observed_at":"2026-08-10T01:39:25.573271Z","submitted_at":"2024-06-06T09:12:30Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03877","snapshot_observed_at":"2026-08-06T21:31:04.509692Z","title":"Bench2drive: Towards multi-ability bench- marking of closed-loop end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.509692Z"},"links":{"cited_paper":"/paper/2406.03877","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:14806aa6964fb382a921a96ec1c056a9d240541fc0259634167a3cb62128613f","observation_id":"38578a71-14e3-43f1-aca0-8dd29613d89c","resolution":{"observed_at":"2026-08-06T21:31:04.509692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07656","last_updated":"2025-07-11T08:15:30Z","snapshot_observed_at":"2026-08-10T01:38:46.185284Z","submitted_at":"2025-03-07T11:41:18Z","title":"DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07656","snapshot_observed_at":"2026-08-06T21:31:04.513157Z","title":"Drivetransformer: Unified transformer for scalable end-to- end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.513157Z"},"links":{"cited_paper":"/paper/2503.07656","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:17f30b5c1c1b553c32caf37125ee2dce1a27da5f271b95b54c51926c2d5621ef","observation_id":"41eabb91-c06c-40d7-9c42-900df6541d45","resolution":{"observed_at":"2026-08-06T21:31:04.513157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19381","last_updated":"2025-06-03T02:28:31Z","snapshot_observed_at":"2026-08-07T14:12:57.110186Z","submitted_at":"2025-05-26T00:49:35Z","title":"DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19381","snapshot_observed_at":"2026-08-06T21:31:04.516550Z","title":"Diffvla: Vision- language guided diffusion planning for autonomous driv- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.516550Z"},"links":{"cited_paper":"/paper/2505.19381","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:8c8bda8ce4bbe060960abed9e9424e7b49cf0eb9b2b4f7fbf948dfa5f4f8bfdb","observation_id":"224a316f-d4fa-4a7b-a4cd-896d8c42f4ef","resolution":{"observed_at":"2026-08-06T21:31:04.516550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-06T21:31:04.520794Z","title":"Senna: Bridging large vision-language mod- els and end-to-end autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.520794Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e03a641ed7633b4a3cfd4b4651dd7244a385165de0fbc023944d5e35c758d3a0","observation_id":"e42c38b3-5667-4a3b-9987-316e834e7550","resolution":{"observed_at":"2026-08-06T21:31:04.520794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.524393Z","title":"Vad: Vectorized scene rep- resentation for efficient autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.524393Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:68be3c8dcc3b8d8a698f681ec6c6ad05ff8ec04c08b0f4adf5694dc640c56ad6","observation_id":"5c35b144-26d3-4866-b0c6-8ca291c57bda","resolution":{"observed_at":"2026-08-06T21:31:04.524393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.527846Z","title":"Koma: Knowledge-driven multi- agent framework for autonomous driving with large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.527846Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:eabfaacd84f1d179067c4101b35ff61ee41a90895b6576892347ef51b46e0a91","observation_id":"8269ba50-47e2-4843-b48a-d34b15368cda","resolution":{"observed_at":"2026-08-06T21:31:04.527846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08964","last_updated":"2024-07-12T03:28:24Z","snapshot_observed_at":"2026-08-03T10:26:14.756945Z","submitted_at":"2024-07-12T03:28:24Z","title":"Communication-Aware Reinforcement Learning for Cooperative Adaptive Cruise Control","version":1},"cited_work":{"arxiv_id":"2407.08964","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08964","snapshot_observed_at":"2026-08-06T21:31:06.137249Z","title":"Communication-Aware Reinforcement Learning for Cooperative Adaptive Cruise Control","venue":"cs.LG","work_id":"d74671d8-bfb0-4f4a-86e6-e7f12de0797f","year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.530858Z"},"links":{"cited_paper":"/paper/2407.08964","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2da7c17ddf1c2a01046db89503622153d61471e7e05a71c7ee7af5dec3d49f9c","observation_id":"848168b4-dbea-4e9c-8ddf-c10b85559472","resolution":{"observed_at":"2026-08-06T21:31:06.177631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.534174Z","title":"Learning to drive in a day","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.534174Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:5e865cc18dd76b48ab3e8905e4fcb105714f9a838f905e3435b216a7b7841c15","observation_id":"faec5161-b732-46ed-bc48-d3785462ad2c","resolution":{"observed_at":"2026-08-06T21:31:04.534174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.537689Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.537689Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:0a02728cef3bbd9ef62f3e14401b9672790b5ef7361dfaf26e0a0cd83a20742e","observation_id":"653bce07-5833-4ada-90fe-b04a282e2f8f","resolution":{"observed_at":"2026-08-06T21:31:04.537689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-06T21:31:04.540761Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.540761Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:271ec22fe31e051a1b8849d252cd9b6a4cff62918e09e4070e297c8c09133477","observation_id":"75ea97e9-bd5c-4ff7-b378-05062533862b","resolution":{"observed_at":"2026-08-06T21:31:04.540761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T21:31:04.544824Z","title":"Open- vla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.544824Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:18c865b25e6756c4caa4aced0059ca179d5df6b5f7c268920d385ea53b4fa5bf","observation_id":"88d37ec8-5d2f-4ecf-8d92-6d7cb7aaa2d4","resolution":{"observed_at":"2026-08-06T21:31:04.544824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.549316Z","title":"A survey on motion prediction and risk assessment for in- telligent vehicles","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.549316Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:cf0a34094e5f009d7e043dba19bf7e2c93ade09ab1c1699f49d900906ed7c482","observation_id":"0261be28-95c3-4a3f-b0dc-7f76815360f1","resolution":{"observed_at":"2026-08-06T21:31:04.549316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-06T21:31:04.553726Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.553726Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:79a91652d6721e5faf0427e9af1054d100f10a12e7f2f2b3f42a9562e88c0be6","observation_id":"4acb9048-e194-4083-bc7f-d33873d302b6","resolution":{"observed_at":"2026-08-06T21:31:04.553726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18341","last_updated":"2025-03-01T10:42:24Z","snapshot_observed_at":"2026-08-10T03:14:04.798408Z","submitted_at":"2024-09-26T23:30:48Z","title":"Navigation-Guided Sparse Scene Representation for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18341","snapshot_observed_at":"2026-08-06T21:31:04.557074Z","title":"Does end-to-end autonomous driving really need perception tasks? arXiv preprint arXiv:2409.18341, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.557074Z"},"links":{"cited_paper":"/paper/2409.18341","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:5cc2fd1d8262dcbd4c3bb27e5b6e1985b2bbeda4fbb1d8a544a62be05f5d9d5d","observation_id":"d42ecad3-38ae-4afa-a415-a0a6ab560be7","resolution":{"observed_at":"2026-08-06T21:31:04.557074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08481","last_updated":"2025-02-28T07:43:38Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:21Z","title":"Enhancing End-to-End Autonomous Driving with Latent World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08481","snapshot_observed_at":"2026-08-06T21:31:04.560587Z","title":"Enhancing end-to- end autonomous driving with latent world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.560587Z"},"links":{"cited_paper":"/paper/2406.08481","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:335fbf2b947834c48e1bc99abc69dd1437f71ec71fc5f0fa3eb85decbc95a3d1","observation_id":"004a1db2-0aa4-40a9-94f9-8ba012b716fd","resolution":{"observed_at":"2026-08-06T21:31:04.560587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.564262Z","title":"Recogdrive: A reinforced cognitive framework for end-to-end autonomous driving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.564262Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:2eb105d311e91491554fb0e67356e324357a690439adc3bce58c2737058c415b","observation_id":"e3f1a3fa-a0a9-4035-9bf7-2035b9e91235","resolution":{"observed_at":"2026-08-06T21:31:04.564262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06978","last_updated":"2024-08-30T03:37:36Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:18:26Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06978","snapshot_observed_at":"2026-08-06T21:31:04.568371Z","title":"Hydra-mdp: End-to-end multimodal plan- ning with multi-target hydra-distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.568371Z"},"links":{"cited_paper":"/paper/2406.06978","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:331d4f719b61b6b901b6f7e76d1a402ed43d1d4f22831c0b8a8cb8a7fe593c6f","observation_id":"01b84402-1ceb-47f6-bd22-f4984485b8b3","resolution":{"observed_at":"2026-08-06T21:31:04.568371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06664","last_updated":"2025-06-07T05:06:05Z","snapshot_observed_at":"2026-08-09T02:59:06.476082Z","submitted_at":"2025-06-07T05:06:05Z","title":"Generalized Trajectory Scoring for End-to-end Multimodal Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06664","snapshot_observed_at":"2026-08-06T21:31:04.572098Z","title":"Generalized trajectory scor- ing for end-to-end multimodal planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.572098Z"},"links":{"cited_paper":"/paper/2506.06664","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:5814496d639a2bb2abb2076ef465250581e755bf0bac72056fe738dc9c6d838b","observation_id":"58283645-65e3-4dc8-be82-d85c9dc06e21","resolution":{"observed_at":"2026-08-06T21:31:04.572098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.576167Z","title":"Pnpnet: End-to-end per- ception and prediction with tracking in the loop","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.576167Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e4ec0cc0e5360d8789957d2e4e8bbc13c88620fac772325bdf462805845cd695","observation_id":"6b37605a-5907-47e3-959b-3713cd1443eb","resolution":{"observed_at":"2026-08-06T21:31:04.576167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.579305Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.579305Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:813ac0274115930b5fb9d934fcb0ad1b39a8c19852bf4f4547e388908c6908e4","observation_id":"e0c04cd3-a3d8-41b6-880b-70f0e1e154a1","resolution":{"observed_at":"2026-08-06T21:31:04.579305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.582341Z","title":"Mtd-gpt: A multi-task decision-making gpt model for autonomous driving at unsignalized intersections","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.582341Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9c3507c9da694a74fd703f38f957f44c3ecd0dde9a749a91e91db86f9da73bc1","observation_id":"44ea8d2f-3f23-4c2f-ae28-109d31e4e189","resolution":{"observed_at":"2026-08-06T21:31:04.582341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.585664Z","title":"Robomamba: Ef- ficient vision-language-action model for robotic reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.585664Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:c69928c1ae712050339e4525b417d6d23bf0c0ed07b58023e9f6ee873c316834","observation_id":"25d0286c-a370-4c1f-8d37-358293a1a5d5","resolution":{"observed_at":"2026-08-06T21:31:04.585664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12667","last_updated":"2025-07-15T09:24:20Z","snapshot_observed_at":"2026-08-07T16:01:35.992289Z","submitted_at":"2025-04-17T05:52:35Z","title":"Fully Unified Motion Planning for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12667","snapshot_observed_at":"2026-08-06T21:31:04.588876Z","title":"Two tasks, one goal: Uniting motion and planning for excellent end to end autonomous driving performance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.588876Z"},"links":{"cited_paper":"/paper/2504.12667","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:cb4a01b4514fa0597b4ff58a134814cf3e375752e6b254a94b05d30eb92ea4aa","observation_id":"6b80e62b-0141-4228-8bbd-3fd7451e7954","resolution":{"observed_at":"2026-08-06T21:31:04.588876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.592420Z","title":"Vlm-e2e: Enhancing end-to-end autonomous driv- ing with multimodal driver attention fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.592420Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:9dc0f550f6bff89ac0e8ee4802fb84eea3bbeba2bb1005b9d0df4c0f83463e4f","observation_id":"a78c074f-2c92-41a6-8e06-99d5163e47a5","resolution":{"observed_at":"2026-08-06T21:31:04.592420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.595814Z","title":"Reasonplan: Unified scene prediction and decision reasoning for closed-loop au- tonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.595814Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e6742cb89a2003ca2ecc0e902823be4efabeaab41df85c2253aa3e5013f77f9e","observation_id":"a9f834fe-66c9-44ec-82ad-36c0632a40ce","resolution":{"observed_at":"2026-08-06T21:31:04.595814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.599077Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.599077Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:8b903a814e65de959e66b0c246084fbcd90b342d5ffa0aaf8295667a7f9b775b","observation_id":"2dd1e3bc-b9ca-4c7b-8123-1e5b6f7222f6","resolution":{"observed_at":"2026-08-06T21:31:04.599077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04821","last_updated":"2024-10-03T00:06:02Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T02:27:25Z","title":"VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04821","snapshot_observed_at":"2026-08-06T21:31:04.602293Z","title":"Vlm-mpc: Vision language foundation model (vlm)-guided model predictive controller (mpc) for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.602293Z"},"links":{"cited_paper":"/paper/2408.04821","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:17d9031776053fe9579040ec07c23b3beb99b31a0cd6ae5a4ab02d322440001d","observation_id":"30478a36-9dec-494f-9251-a392c74f2b68","resolution":{"observed_at":"2026-08-06T21:31:04.602293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02877","last_updated":"2024-03-05T11:39:07Z","snapshot_observed_at":"2026-08-09T22:46:26.112286Z","submitted_at":"2024-03-05T11:39:07Z","title":"ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02877","snapshot_observed_at":"2026-08-06T21:31:04.605560Z","title":"Activead: Planning-oriented active learning for end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.605560Z"},"links":{"cited_paper":"/paper/2403.02877","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a8bb494f132201b6c355d212dc389b25126e38e8ce877d4fa6f2fb9fb3af0feb","observation_id":"f55be80c-fd31-45a6-a185-719224fa5fd1","resolution":{"observed_at":"2026-08-06T21:31:04.605560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.608939Z","title":"Fast and fu- rious: Real time end-to-end 3d detection, tracking and mo- tion forecasting with a single convolutional net","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.608939Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:a1c9c37f2e20c7e7219adefa440aec34205b9511818acb4771efbfe39a0424cc","observation_id":"6b7a9aad-23d7-4b7d-89c1-d3bf8446c354","resolution":{"observed_at":"2026-08-06T21:31:04.608939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.612085Z","title":"Dolphins: Multimodal language model for driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.612085Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1a0d04c13d98caa43adb75b63a7c3829d1355eb4e59620cdaf33e64da6c4b5b6","observation_id":"8342d199-fd35-4553-81a6-23c516a5613a","resolution":{"observed_at":"2026-08-06T21:31:04.612085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-06T21:31:04.615132Z","title":"A survey on vision-language-action models for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.615132Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:f68cc7a1d18e69bf9a142138f501022ff97956336afee2eab70bcf8e67044f3f","observation_id":"89742c4a-fee3-4efe-bba9-f3dac8bf713a","resolution":{"observed_at":"2026-08-06T21:31:04.615132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08168","last_updated":"2025-01-14T14:49:45Z","snapshot_observed_at":"2026-08-09T16:21:08.797578Z","submitted_at":"2025-01-14T14:49:45Z","title":"LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08168","snapshot_observed_at":"2026-08-06T21:31:04.618427Z","title":"Leapvad: A leap in autonomous driving via cogni- tive perception and dual-process thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.618427Z"},"links":{"cited_paper":"/paper/2501.08168","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:5fb5d2cfab283567ca7a80bb7bb86e22dbfa9456d6d00479a08356fdf2dd8cbb","observation_id":"6e81063f-e9f2-41e9-b3cf-77ed23412124","resolution":{"observed_at":"2026-08-06T21:31:04.618427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-06T21:31:04.622875Z","title":"Gpt-driver: Learning to drive with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.622875Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:6903204ecc7aead1259491ef0a356ff23ced8ec0a8fdd37d6e8202c3528ce9a8","observation_id":"cda65a11-b737-4623-b2a2-fbc9896fcb20","resolution":{"observed_at":"2026-08-06T21:31:04.622875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10813","last_updated":"2024-07-28T23:37:51Z","snapshot_observed_at":"2026-08-09T11:49:35.152299Z","submitted_at":"2023-11-17T18:59:56Z","title":"A Language Agent for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10813","snapshot_observed_at":"2026-08-06T21:31:04.626480Z","title":"A language agent for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.626480Z"},"links":{"cited_paper":"/paper/2311.10813","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:56ab15701e38be56127e0a8251578a28edac981ce339766d701c336330894b20","observation_id":"d02d2829-189c-4182-a3c9-f7aa54bf1d9c","resolution":{"observed_at":"2026-08-06T21:31:04.626480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.629874Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.629874Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e18b3433313c003302e1a4992975e53ffa60d0dd095e52bbc59e0a8e0f30287e","observation_id":"83a6066d-1707-4fa5-9bbb-420260d6686b","resolution":{"observed_at":"2026-08-06T21:31:04.629874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15324","last_updated":"2024-10-25T16:00:54Z","snapshot_observed_at":"2026-07-06T18:19:13.078606Z","submitted_at":"2024-05-24T08:07:28Z","title":"Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15324","snapshot_observed_at":"2026-08-06T21:31:04.633849Z","title":"Continuously learning, adapting, and im- proving: A dual-process approach to autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.633849Z"},"links":{"cited_paper":"/paper/2405.15324","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:34277a9ba812e269e30ddfbe4a61a08a5188c9e2d7c92a671c9d5e974fab096e","observation_id":"1ec33b50-ede3-45f7-a0bb-db23a2fe0d2f","resolution":{"observed_at":"2026-08-06T21:31:04.633849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.638377Z","title":"Chatmpc: Natural language based mpc personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.638377Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:3a23d1d1e79fa460968b5f4f1a6ebb443138d731c20633713797ffd402a14b48","observation_id":"e7f686fe-f594-4a44-a100-80d971a5004e","resolution":{"observed_at":"2026-08-06T21:31:04.638377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04338","last_updated":"2025-04-06T03:23:48Z","snapshot_observed_at":"2026-08-07T16:08:18.134993Z","submitted_at":"2025-04-06T03:23:48Z","title":"Data Scaling Laws for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04338","snapshot_observed_at":"2026-08-06T21:31:04.641543Z","title":"Data scaling laws for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.641543Z"},"links":{"cited_paper":"/paper/2504.04338","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1baf9f4cc9c60b25d16f5afc1ded984ad780c12587b36f7e3cad12c14e9e843d","observation_id":"4ef1b1d9-cf11-4a75-bdc3-3bef5054ae1a","resolution":{"observed_at":"2026-08-06T21:31:04.641543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.645337Z","title":"Rea- son2drive: Towards interpretable and chain-based reason- ing for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.645337Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:e6b1003096454b75dc551bf981dbc43624b865ec611d99490920620c4f8937fd","observation_id":"aab49f27-f584-4724-a0ef-1071af9a8d3e","resolution":{"observed_at":"2026-08-06T21:31:04.645337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:31:04.648737Z","title":"Dinov2: Learning robust visual features without supervi- sion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.648737Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:40a05b787a55baed6f4b358796dd236219001235a5d9e277e3ddc7cf847d2ede","observation_id":"50a6587c-3ce2-410d-b1f3-67784e3c7a6a","resolution":{"observed_at":"2026-08-06T21:31:04.648737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.652503Z","title":"A survey of motion planning and control techniques for self-driving urban vehicles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.652503Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:b6df4efde1764e3c93deb7738b0013c9b0185b3ca9943a26b8cc3b458cbc854f","observation_id":"2bd0575f-59dd-4132-9ead-ab10afbd4ff6","resolution":{"observed_at":"2026-08-06T21:31:04.652503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.656685Z","title":"Vlp: Vision language planning for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.656685Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:7ab953071d9040bf2ccf44e3c0a8ebb491efb51e1a917bb6d6b844919a1de877","observation_id":"ae903616-2e2d-4ab7-a36c-49d69a2c4e2e","resolution":{"observed_at":"2026-08-06T21:31:04.656685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.659895Z","title":"Lego-drive: Language-enhanced goal-oriented closed-loop end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.659895Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:7cfc99f7f96513ff2685f033d2edab63c4fd5a020232847fa1f2331e07560a29","observation_id":"d4f55e8d-20a7-4b11-897b-961c39ea1760","resolution":{"observed_at":"2026-08-06T21:31:04.659895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-06T21:31:04.663325Z","title":"Fast: Efficient action tokeniza- tion for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.663325Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:ff41427fa1baa3b88cb792bd3e1cfdb8a16934edbe1b881b88bfe0189bfa2b35","observation_id":"29f45af6-fa90-40c6-93e8-d9eddb9426a5","resolution":{"observed_at":"2026-08-06T21:31:04.663325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:31:04.667282Z","title":"Agentthink: A unified framework for tool-augmented chain-of-thought reasoning in vision- language models for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.667282Z"},"links":{"citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:40204dfd420e708af430ac1e88d2cde92fd62c5c7396860ef0302b143e886b90","observation_id":"c2c0b6f3-5add-43e1-8983-a090cf69e547","resolution":{"observed_at":"2026-08-06T21:31:04.667282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08162","last_updated":"2025-03-11T08:27:01Z","snapshot_observed_at":"2026-08-07T17:13:57.021388Z","submitted_at":"2025-03-11T08:27:01Z","title":"FASIONAD++ : Integrating High-Level Instruction and Information Bottleneck in FAt-Slow fusION Systems for Enhanced Safety in Autonomous Driving with Adaptive Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08162","snapshot_observed_at":"2026-08-06T21:31:04.670504Z","title":"Fasionad++: Integrating high-level instruc- tion and information bottleneck in fat-slow fusion systems for enhanced safety in autonomous driving with adaptive feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.670504Z"},"links":{"cited_paper":"/paper/2503.08162","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:c1fcd8a53d1845fa976fa2f7636295fa4f86781407ab7455d582397fed72a614","observation_id":"bd8d2423-3ca1-44ce-bdaa-d1c46b3f86ec","resolution":{"observed_at":"2026-08-06T21:31:04.670504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-06T21:31:04.674245Z","title":"Spatialvla: Exploring spatial represen- tations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.674245Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:056f95aa5b15154652f433dd90891afd1dcb7d0e3fa437371f36d74cc0173df9","observation_id":"a020dcbf-7044-407c-8e17-0afe8753c195","resolution":{"observed_at":"2026-08-06T21:31:04.674245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":166},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 166 outbound references and 14 inbound Pith citation observations for arXiv:2506.24044."}