{"as_of":"2026-08-15T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fc667cd73309a33b014d87ae9706aa323278d9399ecb5185745431b7da73a56","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:43:58.997932Z","state":"measured"},{"denominator":116,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":116,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:31:04.384791Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T08:36:59.862431Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-06T21:31:04.384791Z","title":"Impromptu vla: Open weights and open data for driving vision- language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-12T19:26:12.850812Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.384791Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:1a64d2b554de7e2795ff74e20bd675f0fe31c75a5de920b7baa8fe7165b0a6ec","observation_id":"ae9035c8-cebe-40f7-8752-3275413763fa","resolution":{"observed_at":"2026-08-06T21:31:04.384791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T21:29:09.319498Z","title":"Chi, H.-a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-14T04:43:41.682253Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:09.319498Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:ce9f6a642ba94f0de372d90f4da97e6913550128db76ad4cdbf2b88435959d9c","observation_id":"196d0325-5a3a-45f0-8a4f-148bbc2a9828","resolution":{"observed_at":"2026-08-04T21:29:09.319498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T20:10:13.346389Z","title":"Chi, H.-a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-14T15:31:59.893476Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.346389Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:e4c59ff3a34ca035dbe86ad1914005f241050598169dfbbd6af305fdf384397d","observation_id":"5c04cba9-c92c-419f-8919-09e294d9f439","resolution":{"observed_at":"2026-08-04T20:10:13.346389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T19:19:25.999539Z","title":"Impromptu vla: Open weights and open data for driv- ing vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10570","last_updated":"2025-09-11T10:30:06Z","snapshot_observed_at":"2026-08-09T17:39:56.182010Z","submitted_at":"2025-09-11T10:30:06Z","title":"Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-04T19:19:25.999539Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2509.10570"},"observation_digest":"sha256:2271c5a6c500e9521f3b05efcd13ca7b99133b961e38014c0abdb3ad3d687f3b","observation_id":"2fd31518-1945-4c47-9f28-8ff102d89257","resolution":{"observed_at":"2026-08-04T19:19:25.999539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-04T08:57:06.465834Z","title":"Impromptu vla: Open weights and open data for driving vision-language-action models.arXiv preprint arXiv:2505.23757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18313","last_updated":"2026-06-29T02:20:45Z","snapshot_observed_at":"2026-08-06T20:20:34.094359Z","submitted_at":"2025-10-21T05:49:01Z","title":"OmniNWM: Omniscient Driving Navigation World Models","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:57:06.465834Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2510.18313"},"observation_digest":"sha256:dc5e9030d5d4ba1460ea9d2c4f19e5091a53add70582673afe7d03e7008a81c5","observation_id":"1f7b0815-e253-4a45-8645-c237db0073a8","resolution":{"observed_at":"2026-08-04T08:57:06.465834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T02:35:13.126171Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2511.00088"},"observation_digest":"sha256:de64a5a87aa2548c0d27459230a5ad349d27d294441b6c6c178cef84d9da74a7","observation_id":"6ece5e9a-6bc4-4cb6-831b-a8860fccd60d","resolution":{"observed_at":"2026-05-18T02:35:13.234197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-03T16:52:50.875760Z","title":"arXiv preprint arXiv:2505.23757","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-03T16:52:46.785804Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:50.875760Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:ec60f4df1d6eab61e0f9890e69be7d7de53f9c8b849fcef1df5833b2dba0732d","observation_id":"f66ab2f8-169a-4d0e-9e54-7b985db40f93","resolution":{"observed_at":"2026-08-03T16:52:50.875760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-02T21:19:52.228992Z","title":"Impromptu vla: Open weights and open data for driving vision-language-actionmodels[J].arXivpreprintarXiv:2505.23757,2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20575","last_updated":"2026-07-18T07:58:59Z","snapshot_observed_at":"2026-08-13T14:17:15.961474Z","submitted_at":"2026-02-24T05:57:18Z","title":"An interactive enhanced driving dataset for autonomous driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:19:52.228992Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2602.20575"},"observation_digest":"sha256:3f57448f67add244b9894b7d9e5633771973aa251328254da593d17ab488467a","observation_id":"bf88cfa6-ffb5-41e2-be72-78f8cca2a231","resolution":{"observed_at":"2026-08-02T21:19:52.228992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-08-02T21:12:24.280721Z","title":"Impromptu vla: Open weights and open data for driving vision-language- action models.arXiv preprint arXiv:2505.23757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21172","last_updated":"2026-06-05T21:24:23Z","snapshot_observed_at":"2026-08-10T17:01:21.950489Z","submitted_at":"2026-02-24T18:17:21Z","title":"NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:24.280721Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2602.21172"},"observation_digest":"sha256:2e13b84a439116500743b79ae86301ffe1b4b96e2eddfdb673cfea163b984765","observation_id":"f1bf4274-ba9d-4722-af5d-70e5225b7d90","resolution":{"observed_at":"2026-08-02T21:12:24.280721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2603.09465","last_updated":"2026-05-11T07:51:23Z","snapshot_observed_at":"2026-08-14T11:17:42.797216Z","submitted_at":"2026-03-10T10:19:07Z","title":"EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:14:45.982490Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2603.09465"},"observation_digest":"sha256:125f08f26577b1993b1588b2929b16f159ab20aaa4b07f7dfe7c2f5c95e8e66c","observation_id":"96755b8f-5a6b-47f2-9dbc-ff4a36ee3874","resolution":{"observed_at":"2026-05-15T14:15:54.611568Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2603.19675","last_updated":"2026-05-03T12:12:49Z","snapshot_observed_at":"2026-07-29T22:55:09.570425Z","submitted_at":"2026-03-20T06:19:31Z","title":"DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T09:07:01.727331Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2603.19675"},"observation_digest":"sha256:6a0760d22a5c6f42995252bf29c1dc14cf12a5ce72cc53fa7f01af161dce1e13","observation_id":"dc71aff4-7332-468f-935f-4088eb4fccf0","resolution":{"observed_at":"2026-05-15T09:09:53.310593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.09059","last_updated":"2026-04-10T07:38:05Z","snapshot_observed_at":"2026-08-11T05:50:21.013355Z","submitted_at":"2026-04-10T07:38:05Z","title":"Learning Vision-Language-Action World Models for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:08:10.442655Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.09059"},"observation_digest":"sha256:010681efbfd2f76128c32621ed7f29231986d2cec5b80029b3d171f032d7aa4d","observation_id":"c10fb34f-1770-4aa9-be17-16998f63e453","resolution":{"observed_at":"2026-05-11T07:31:00.784336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.17915","last_updated":"2026-04-20T07:50:00Z","snapshot_observed_at":"2026-08-11T09:37:34.770051Z","submitted_at":"2026-04-20T07:50:00Z","title":"OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T04:27:24.653711Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.17915"},"observation_digest":"sha256:8f516bba63100db0ca5927efa74c03af08cc498a12f8d0ce37895cf6ef8ec679","observation_id":"102e638e-1929-4de6-b939-7ec014fc23f3","resolution":{"observed_at":"2026-05-11T11:56:25.641365Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:37b5fb0da50e3f58e08ff18cb11cdd9d7f74f12b66dcc60a908c5eed77195fe3","observation_id":"18343ed0-f8e3-4702-9396-71794fb63389","resolution":{"observed_at":"2026-07-05T11:41:02.538983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-08-10T23:34:51.220731Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:48b2db66c9f7ea56274bc191ad63c0acc3b27c0d91ebd14079e1f07b445f884e","observation_id":"a57e6d60-440d-49cd-b71f-72e0af0f88c8","resolution":{"observed_at":"2026-05-10T05:51:10.265223Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.22851","last_updated":"2026-07-07T12:47:51Z","snapshot_observed_at":"2026-08-11T12:50:12.387477Z","submitted_at":"2026-04-22T07:49:02Z","title":"EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T00:09:18.068337Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.22851"},"observation_digest":"sha256:74b42b808b5541006d33e682d9c24d28f1fb31c4bf4827354a659396b1bbb734","observation_id":"2a6caab4-0303-4337-a55f-79cfb4dd03f0","resolution":{"observed_at":"2026-05-10T00:19:47.186985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2604.24086","last_updated":"2026-04-27T06:20:15Z","snapshot_observed_at":"2026-08-03T03:51:20.015005Z","submitted_at":"2026-04-27T06:20:15Z","title":"AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T03:18:03.855477Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2604.24086"},"observation_digest":"sha256:6897a747907ea2768bcd8de6e36177163434551e9b02b352af606b9bdd0819f3","observation_id":"db4d8c7c-7ec7-43ce-9cc4-f1f3239dca43","resolution":{"observed_at":"2026-05-11T22:11:13.827738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-08-11T15:34:29.901545Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:54:50.887381Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:fb5ca3bec93dfca0b64eff93cd607464ce8d4544579babcde93663002a0c952c","observation_id":"a2f4e5b7-4af1-487a-b581-34cec67da7b9","resolution":{"observed_at":"2026-05-14T20:59:28.107280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.12624","last_updated":"2026-05-14T17:59:31Z","snapshot_observed_at":"2026-08-11T15:34:29.901545Z","submitted_at":"2026-05-12T18:09:42Z","title":"MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T05:07:58.953866Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.12624"},"observation_digest":"sha256:678180047fc13284e4fb642fb2b67d4563e0750aff070fd8aaf149085f875074","observation_id":"ce5fa6dc-884f-491f-a29b-7d7767cbc6ee","resolution":{"observed_at":"2026-05-15T05:09:45.382811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.15120","last_updated":"2026-05-15T11:07:11Z","snapshot_observed_at":"2026-08-12T19:26:11.644798Z","submitted_at":"2026-05-14T17:32:18Z","title":"CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T20:57:06.455108Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.15120"},"observation_digest":"sha256:8e4db99008f0d8a12bc355060f3d7a776aa07b89d297430323fd083f8e9c3416","observation_id":"5d1bdaca-ec1a-45c0-abb1-3e0d717c4206","resolution":{"observed_at":"2026-05-20T20:59:01.699297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.21061","last_updated":"2026-05-20T11:45:32Z","snapshot_observed_at":"2026-08-11T20:41:27.118194Z","submitted_at":"2026-05-20T11:45:32Z","title":"Grounding Driving VLA via Inverse Kinematics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:33:34.750047Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.21061"},"observation_digest":"sha256:a36f2aae65cc8df7fd6f68181464d89af7780c2897465d5fdd2cd8b616adf46a","observation_id":"eb88c94d-c203-4732-8dd5-2b3ec0f04ac8","resolution":{"observed_at":"2026-05-21T05:33:58.357428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.31041","last_updated":"2026-05-29T09:18:32Z","snapshot_observed_at":"2026-08-12T22:21:45.186468Z","submitted_at":"2026-05-29T09:18:32Z","title":"Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:39:32.487156Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.31041"},"observation_digest":"sha256:b8bc0bc9f533ac13509d79dcd38395126f4ed56c9a60cada876dd80dd8a64364","observation_id":"060aea4e-8b4d-4cac-8f62-43a0d117a65b","resolution":{"observed_at":"2026-06-28T22:42:46.544305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2605.31572","last_updated":"2026-05-29T17:40:04Z","snapshot_observed_at":"2026-08-14T13:09:40.000236Z","submitted_at":"2026-05-29T17:40:04Z","title":"nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:04.552901Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2605.31572"},"observation_digest":"sha256:be20711fc3b22ccb181768120a03b7224367b4bb908b0a7c414c2e726a89836b","observation_id":"ad0db585-6a53-4775-9363-3f47ad8aa934","resolution":{"observed_at":"2026-07-01T19:26:00.310988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2606.02774","last_updated":"2026-06-01T18:36:46Z","snapshot_observed_at":"2026-08-13T01:20:35.398994Z","submitted_at":"2026-06-01T18:36:46Z","title":"GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T14:45:54.904876Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2606.02774"},"observation_digest":"sha256:e2fe3f177ca42970a7bd44f3a88efc6740871c1492fab0b7b1b05264cf6bc59a","observation_id":"2675bb56-f3c4-435f-98cb-17f099b597ca","resolution":{"observed_at":"2026-07-01T23:06:19.763326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2606.18242","last_updated":"2026-06-16T17:58:40Z","snapshot_observed_at":"2026-08-13T11:51:54.392752Z","submitted_at":"2026-06-16T17:58:40Z","title":"EventDrive: Event Cameras for Vision-Language Driving Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:43.752335Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2606.18242"},"observation_digest":"sha256:df2c4d05f9b262dc92450b2feaed0a501ca9412ff4010e8c17e54a681cbbac09","observation_id":"b36d16e5-a5a3-4960-ae6f-89b354f46b6a","resolution":{"observed_at":"2026-07-03T20:18:57.106030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2607.01658","last_updated":"2026-07-02T03:34:32Z","snapshot_observed_at":"2026-08-11T08:51:15.758036Z","submitted_at":"2026-07-02T03:34:32Z","title":"Teaching Vision-Language-Action Models What to See and Where to Look","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T16:42:13.520913Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.01658"},"observation_digest":"sha256:b0066fa81a40312ece22cc819f0165215ef6b739974e962ca716b8d77834a67d","observation_id":"40521f0b-87c1-4641-8430-fd7a0260f15d","resolution":{"observed_at":"2026-07-03T16:48:39.587385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2607.07103","last_updated":"2026-07-08T07:39:21Z","snapshot_observed_at":"2026-08-15T02:51:09.667966Z","submitted_at":"2026-07-08T07:39:21Z","title":"A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T20:11:02.051543Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.07103"},"observation_digest":"sha256:8e77018c63e41d932bc9343aaeb27f3db803dc9d161fc2faab6c5f16c8ed38a5","observation_id":"7c17c601-7636-4dc0-9aef-31e85dd41760","resolution":{"observed_at":"2026-07-09T20:16:29.462683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.23757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-10T08:36:59.862431Z","title":"Chi, H.-a","venue":"cs.CV","work_id":"eb7dbfdb-1c0e-4e76-8cc5-ff8a12e35ad8","year":2025},"citing_paper":{"arxiv_id":"2607.08375","last_updated":"2026-07-09T11:49:57Z","snapshot_observed_at":"2026-08-13T13:52:25.802411Z","submitted_at":"2026-07-09T11:49:57Z","title":"WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T08:30:29.351159Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.08375"},"observation_digest":"sha256:f9bcf4c3ee1629539532429b5f687c504a26d82d6053d52ba9fdafafdeca154c","observation_id":"866d70bb-612c-4630-b88e-85afed4dc9b8","resolution":{"observed_at":"2026-07-10T08:36:59.863731Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23757","snapshot_observed_at":"2026-07-14T12:33:06.583512Z","title":"Impromptu vla: Open weights and open data for driving vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10336","last_updated":"2026-07-11T14:36:40Z","snapshot_observed_at":"2026-08-15T07:51:32.488791Z","submitted_at":"2026-07-11T14:36:40Z","title":"PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T12:33:06.583512Z"},"links":{"cited_paper":"/paper/2505.23757","citing_paper":"/paper/2607.10336"},"observation_digest":"sha256:7a8ec0525f18a62f498a681ba9068d95053abc4b5e01e6433b69f895622e82e1","observation_id":"de6d88e8-cce2-4956-9193-a8291c402400","resolution":{"observed_at":"2026-07-14T12:33:06.583512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23757/citation-record","integrity":"/paper/2505.23757/integrity","json":"/paper/2505.23757/citation-record.json","paper":"/paper/2505.23757"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:43:52.448551Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.448551Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:68aa60bd21ec8862c05b77ce8ecb9efdfdad415c2f6eaec86c57db35cb92a1e2","observation_id":"a10d2d51-7056-40df-85db-bffb9279fc94","resolution":{"observed_at":"2026-08-07T12:43:52.448551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:43:52.550258Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.550258Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:4a3376df51d44418a6bcace3d4f0d05ce61dd8103befc9296d5af9fbdcb94667","observation_id":"0e1a8d2b-7c83-4323-af40-283c5fcaa33a","resolution":{"observed_at":"2026-08-07T12:43:52.550258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:43:52.772359Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.772359Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:65f877b29873e56e59eb4c319de9e2907ade8fa57d16eb53b991d675365fafd9","observation_id":"b502bf3b-0a0d-41e8-991d-08adcc1c2fd2","resolution":{"observed_at":"2026-08-07T12:43:52.772359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:52.884004Z","title":"Fishyscapes: A benchmark for safe semantic segmentation in autonomous driving","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:52.884004Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:da43efe97181f136a6b5fa2b2037760155bcbc3ad02c034c080273103f68dcf5","observation_id":"7bbad7fa-4c5a-4587-b967-7465c9bdef93","resolution":{"observed_at":"2026-08-07T12:43:52.884004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06370","last_updated":"2024-09-30T22:02:34Z","snapshot_observed_at":"2026-08-12T23:46:22.454751Z","submitted_at":"2024-06-10T15:32:16Z","title":"UMAD: Unsupervised Mask-Level Anomaly Detection for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06370","snapshot_observed_at":"2026-08-07T12:43:53.034369Z","title":"Umad: Unsupervised mask-level anomaly detection for autonomous driving.arXiv preprint arXiv:2406.06370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.034369Z"},"links":{"cited_paper":"/paper/2406.06370","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0c9dfcac572410731f741cf36d70b62edc2a43d3cd2b0e60344b2582622767c5","observation_id":"80a78b90-59ec-43a0-9dad-eb2e8c3343ca","resolution":{"observed_at":"2026-08-07T12:43:53.034369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.121418Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.121418Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6176e12c39cad21b058f4452d95f7c07d62cf8f4070fe1f8972fa30e0a350564","observation_id":"d1ce83ed-dc78-4220-999f-e1b49e987b28","resolution":{"observed_at":"2026-08-07T12:43:53.121418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11810","last_updated":"2022-02-04T02:50:02Z","snapshot_observed_at":"2026-08-13T09:27:32.843417Z","submitted_at":"2021-06-22T14:24:55Z","title":"NuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11810","snapshot_observed_at":"2026-08-07T12:43:53.171614Z","title":"nuplan: A closed-loop ml-based planning benchmark for autonomous vehicles.arXiv preprint arXiv:2106.11810, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.171614Z"},"links":{"cited_paper":"/paper/2106.11810","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e608e486e424c4bbc40bb907d46a7326890a4373aa32c033a3806824f55cef5e","observation_id":"26736415-571b-4adb-a88b-48c0ee75a23c","resolution":{"observed_at":"2026-08-07T12:43:53.171614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.235636Z","title":"Argoverse: 3d tracking and forecasting with rich maps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.235636Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:12ea1faddbbcf4a46f598e524d10215d225095936476e1603be3d940eae4c17b","observation_id":"24317afe-9fc7-40a7-b2d5-22bac49689db","resolution":{"observed_at":"2026-08-07T12:43:53.235636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01957","last_updated":"2023-10-13T21:59:27Z","snapshot_observed_at":"2026-08-15T19:46:29.281671Z","submitted_at":"2023-10-03T11:05:14Z","title":"Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01957","snapshot_observed_at":"2026-08-07T12:43:53.357114Z","title":"Driving with llms: Fusing object-level vector modality for explainable autonomous driving.arXiv preprint arXiv:2310.01957, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.357114Z"},"links":{"cited_paper":"/paper/2310.01957","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:7ffaa576365a6911619502669253c730e88e9571c7f7388bc029944608844682","observation_id":"3208e4ff-2c46-43c4-98ee-3ba3029e6d94","resolution":{"observed_at":"2026-08-07T12:43:53.357114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-14T22:14:39.326583Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-07T12:43:53.449636Z","title":"Vadv2: End-to-end vectorized autonomous driving via probabilistic planning.arXiv preprint arXiv:2402.13243, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.449636Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:36a3d31801e1f0f589e10ac1c406345ebfcb85d1e1c11d7a5702bc5a8261f29b","observation_id":"212a2b96-5d96-445c-8edd-38255f37563b","resolution":{"observed_at":"2026-08-07T12:43:53.449636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.498716Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.498716Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:389d193c1272f7762ed7286f46dcca101aba3bfafb10c9fa62f4aefa8d4b2ddc","observation_id":"2a60960a-d589-4686-b944-501628b7dc39","resolution":{"observed_at":"2026-08-07T12:43:53.498716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.560050Z","title":"Exploring the limitations of behavior cloning for autonomous driving","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.560050Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d8ce8c869556fe50aa0c296d3d4c0c37e19bf38fc7b5f5dcffc725ed59bc5dbc","observation_id":"63e28846-2f63-4b4d-abfa-16f5b69a3f7b","resolution":{"observed_at":"2026-08-07T12:43:53.560050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.653787Z","title":"Navsim: Data-driven non- reactive autonomous vehicle simulation and benchmarking.Advances in Neural Information Processing Systems, 37:28706–28719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.653787Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:afd6a93c0ad45bf79cc623b9a2c7976fd9dbb70cb4d7998a88238e1c7d0c2c9c","observation_id":"1350197a-208c-452c-a0ee-40388fa8fc18","resolution":{"observed_at":"2026-08-07T12:43:53.653787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10838","last_updated":"2020-08-26T06:27:52Z","snapshot_observed_at":"2026-08-15T06:33:17.658562Z","submitted_at":"2019-09-24T12:29:27Z","title":"Talk2Car: Taking Control of Your Self-Driving Car","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10838","snapshot_observed_at":"2026-08-07T12:43:53.696335Z","title":"Talk2car: Taking control of your self-driving car.arXiv preprint arXiv:1909.10838, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.696335Z"},"links":{"cited_paper":"/paper/1909.10838","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0c069ad949028a8ae42c651b7cc5552cc3e55ada5229597ee2e597cec58f5b2b","observation_id":"d295e31f-64dc-42ab-bb2a-e584f48cca0c","resolution":{"observed_at":"2026-08-07T12:43:53.696335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.721481Z","title":"Pixel-wise anomaly detection in complex driving scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.721481Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:3b0d117173b62584bf046d52b3235d50d41e9733435428a9d7631ab3ec8f964e","observation_id":"0759dfdb-5a24-45cb-83f9-8a88413ea2f3","resolution":{"observed_at":"2026-08-07T12:43:53.721481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06702","last_updated":"2024-09-10T17:59:40Z","snapshot_observed_at":"2026-08-15T13:52:56.737143Z","submitted_at":"2024-09-10T17:59:40Z","title":"Hint-AD: Holistically Aligned Interpretability in End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06702","snapshot_observed_at":"2026-08-07T12:43:53.752395Z","title":"Hint-ad: Holistically aligned interpretability in end-to-end autonomous driving.arXiv preprint arXiv:2409.06702, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.752395Z"},"links":{"cited_paper":"/paper/2409.06702","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:923f79cfe867e0ce87ce6a42078f5171a331446dc2da847c66c78be2193800d0","observation_id":"aa9b24ba-3d67-4b4b-ab1b-951511837eed","resolution":{"observed_at":"2026-08-07T12:43:53.752395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.369938Z","title":"Idd-3d: Indian driving dataset for 3d unstructured road scenes","venue":null,"work_id":"a164a167-7194-41bd-96b6-e1a73213e503","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.830196Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:8fc7565084e0dc06691d6db3761825cea997c35f016f5a5a3c804afde3738039","observation_id":"63aef99d-c6b4-45a9-88a0-8d37a5329bda","resolution":{"observed_at":"2026-08-07T12:44:07.427101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:53.895816Z","title":"Carla: An open urban driving simulator","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.895816Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:10be6ede1ef7ef5b14d072c3e8d4b2aa4313f6b436f26cd8671a532ce2d811e1","observation_id":"76d49308-e499-476f-a0a7-f6ea89406f18","resolution":{"observed_at":"2026-08-07T12:43:53.895816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.108410Z","title":"Scp- diff: Spatial-categorical joint prior for diffusion based semantic image synthesis","venue":null,"work_id":"846b5d78-8f6a-41c5-953a-ef44d04823ba","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:53.949655Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:451eeb4e1b52ed42cd053e4d4ee02a76dc1fd75a4ea70ef096846aa8625921e4","observation_id":"93aea4b8-0a05-4728-b8ae-2daddcb8919f","resolution":{"observed_at":"2026-08-07T12:44:07.220851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.073828Z","title":"Vision meets robotics: The kitti dataset.The international journal of robotics research, 32(11):1231–1237, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.073828Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c5959243d4a98071ed11d34935a00068a53c2ec54e4421057fd4a142b8e061b1","observation_id":"afc9e56e-04ce-49ed-972b-56964b82372b","resolution":{"observed_at":"2026-08-07T12:43:54.073828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.882949Z","title":"St-p3: End-to-end vision-based autonomous driving via spatial-temporal feature learning","venue":null,"work_id":"313e939c-fb03-421a-8a50-6fa78a0944e7","year":2022},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.163868Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:19e62de9c575193fa742b7182fd60f309ca7556674d879256a280c3c8ca16510","observation_id":"d96b76f2-f3a2-4d7c-8b9a-bacc479beac4","resolution":{"observed_at":"2026-08-07T12:44:06.973594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.680477Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"951c6332-e72f-4466-a9a5-36cacd4efe1b","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.308023Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:2300a7d6fe2e14d2395fcca3fb40fc60cf1bb50b3cbb482d68502e1d67109e32","observation_id":"73d29622-2013-47dd-9ff6-7c26a05aea5b","resolution":{"observed_at":"2026-08-07T12:44:06.751459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:43:54.581479Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.581479Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c45e8e765359a3dd0e506427fac018c2b483e7fdbff37a0bed1e710ac398ccb5","observation_id":"29ed6ffb-3f55-4935-8502-a113f19e44b6","resolution":{"observed_at":"2026-08-07T12:43:54.581479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-07T12:43:54.713487Z","title":"Emma: End-to-end multimodal model for autonomous driving.arXiv preprint arXiv:2410.23262, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.713487Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:769f6c935ff63eb5174a73eeb4cc787c3d0b2bc4819dc657932811e74c93d277","observation_id":"9746c94c-552a-4f6f-a3cf-e51c4af7cde6","resolution":{"observed_at":"2026-08-07T12:43:54.713487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:54.988387Z","title":"Driveadapter: Breaking the coupling barrier of perception and planning in end-to-end au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:54.988387Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:858def8a27d7946fd0c19f42920a982f833e51f210ae5bd031a830772ea9ab5c","observation_id":"61f869b5-bc0a-48bf-95f8-9d73ada5e3a0","resolution":{"observed_at":"2026-08-07T12:43:54.988387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03877","last_updated":"2024-11-27T09:31:04Z","snapshot_observed_at":"2026-08-12T23:48:59.114108Z","submitted_at":"2024-06-06T09:12:30Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03877","snapshot_observed_at":"2026-08-07T12:43:55.071281Z","title":"Bench2drive: Towards multi-ability benchmarking of closed-loop end-to-end autonomous driving.arXiv preprint arXiv:2406.03877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.071281Z"},"links":{"cited_paper":"/paper/2406.03877","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e924153ef55d5e73773ffde283de2d4d1a81d8336cbfc39145512e857a100345","observation_id":"6b2882a8-35d7-433d-9b7b-e2f18872a0c0","resolution":{"observed_at":"2026-08-07T12:43:55.071281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-07T12:43:55.159426Z","title":"Senna: Bridging large vision-language models and end-to-end autonomous driving.arXiv preprint arXiv:2410.22313, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.159426Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d10fb74927f5707ab6a0a50c7b5cf5b9719b41d57fda2d504401ab4d3d75e026","observation_id":"c0930aff-f9ef-424a-b145-d4c73b2cdbb8","resolution":{"observed_at":"2026-08-07T12:43:55.159426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:55.204126Z","title":"Vad: Vectorized scene representation for efficient autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.204126Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:92288a37bf436c917fbf2e3901b1f7c062acffd768fb98948ff04c3de79769d1","observation_id":"b9183ddc-f8f5-41e7-b2cd-44a86d43be99","resolution":{"observed_at":"2026-08-07T12:43:55.204126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.402686Z","title":"P-mapnet: Far-seeing map generator enhanced by both sdmap and hdmap priors.IEEE Robotics and Automation Letters, 2024","venue":null,"work_id":"a5d39c8b-f3cf-45ab-b922-47d9066a3adf","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.252353Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:66ebbd62e04341315d0b7af004d22a033882f39b2e1696eec07d1022328d762d","observation_id":"23f3dfe6-0b3b-40b5-8fa2-5a41c99b67e9","resolution":{"observed_at":"2026-08-07T12:44:06.488874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.232442Z","title":"Adapt: Action-aware driving caption transformer","venue":null,"work_id":"24b664c9-01a7-4c4d-9116-1e41c3553c0e","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.289844Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d44c4db406d152e5ee45dd77d3ca3668ac1baa67f2592d6d0b19b90b6f27519b","observation_id":"f801b714-02da-4f08-a8cb-e5fe5dec14ba","resolution":{"observed_at":"2026-08-07T12:44:06.304166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.109361Z","title":"Tod3cap: Towards 3d dense captioning in outdoor scenes","venue":null,"work_id":"02387aa8-74c9-49de-bc98-cc73a51e5a5d","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.393975Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e27c998995cbee89355b465b8e966f8da18ac13353fa06944bf8f3cb8502070c","observation_id":"c2977a51-0889-45fc-9f9a-eec082c71f38","resolution":{"observed_at":"2026-08-07T12:44:06.161345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.960132Z","title":"Textual explana- tions for self-driving vehicles","venue":null,"work_id":"1b6805b0-63ad-4f7f-87f4-43ea6e77bb12","year":2018},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.528628Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ee800b8a5160811ad7ec7e411dae0e42691f23ccc2003b9c4073cf8d4b136c1d","observation_id":"f7453340-93d8-47f1-a77c-e2ff434849d1","resolution":{"observed_at":"2026-08-07T12:44:06.032612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05435","last_updated":"2025-03-11T12:38:27Z","snapshot_observed_at":"2026-08-13T01:26:48.610490Z","submitted_at":"2024-12-06T21:41:52Z","title":"UniScene: Unified Occupancy-centric Driving Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05435","snapshot_observed_at":"2026-08-07T12:43:55.666234Z","title":"Uniscene: Unified occupancy-centric driving scene generation.arXiv preprint arXiv:2412.05435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.666234Z"},"links":{"cited_paper":"/paper/2412.05435","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:502b70f74ef33af0f5d0ec710be7625dbb39d95c0980fc592284dfa5aa326816","observation_id":"96e917c7-891a-4741-a3a0-f65f89451a23","resolution":{"observed_at":"2026-08-07T12:43:55.666234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14801","last_updated":"2025-03-04T10:28:47Z","snapshot_observed_at":"2026-08-14T05:05:21.079989Z","submitted_at":"2025-02-20T18:22:44Z","title":"AVD2: Accident Video Diffusion for Accident Video Description","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14801","snapshot_observed_at":"2026-08-07T12:43:55.791504Z","title":"Avd2: Accident video diffusion for accident video description.arXiv preprint arXiv:2502.14801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.791504Z"},"links":{"cited_paper":"/paper/2502.14801","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6fd59b2f1b978c9bf16c3b10023c80daa34f68a358e92020593c3bd34f7c628f","observation_id":"9e33c1fd-63ca-4d13-adbb-b191182b7e87","resolution":{"observed_at":"2026-08-07T12:43:55.791504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08481","last_updated":"2025-02-28T07:43:38Z","snapshot_observed_at":"2026-08-12T19:25:13.769047Z","submitted_at":"2024-06-12T17:59:21Z","title":"Enhancing End-to-End Autonomous Driving with Latent World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08481","snapshot_observed_at":"2026-08-07T12:43:55.915576Z","title":"Enhancing end-to-end autonomous driving with latent world model.arXiv preprint arXiv:2406.08481, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:55.915576Z"},"links":{"cited_paper":"/paper/2406.08481","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c2ce8d21cc46a25bc64c9aeaf8d3b2a71ca2f6323c42c61ef413eb88f6e3a849","observation_id":"0164c948-f712-4a29-bc9a-816a9a0a1e33","resolution":{"observed_at":"2026-08-07T12:43:55.915576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.811591Z","title":"Is ego status all you need for open-loop end-to-end autonomous driving? 2024","venue":null,"work_id":"f6478d76-a113-4d6f-8769-b0389a1bf63e","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.024688Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0d5f754881e1cb36d059c789afef72543e96b459e7a58387b84060a9fd8e4c99","observation_id":"229fed82-a5b1-4018-a3ad-5abc1885bac8","resolution":{"observed_at":"2026-08-07T12:44:05.860962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.705667Z","title":"Detecting the unexpected via image resynthesis","venue":null,"work_id":"887d7b45-8956-4caa-8a4c-4ca40d7693b3","year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.126520Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:53d44989e56d437b59e1517953d08f3dee40e00f69987778c4246b50ace3a047","observation_id":"e71fedcd-2e9b-4f44-8409-b1a0e40fa1a3","resolution":{"observed_at":"2026-08-07T12:44:05.763750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.188348Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.188348Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:3e087844cb0394013365cf45335914ef3173abd62cd2af210b2e2a9639f42c9f","observation_id":"628b128c-94a6-47d4-ba42-02873735dabe","resolution":{"observed_at":"2026-08-07T12:43:56.188348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.478245Z","title":"Neural rendering for safety-critical autonomous driving simulation","venue":null,"work_id":"1315b88e-bbef-441f-832f-d0dc9d152df8","year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.271318Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:2c07de2c6d8f5a928791f7e2b49b1752cc42f860d9e923b604d34e5830b3d37e","observation_id":"b409e9d3-1593-4dc3-bbb6-43de91bf6fdf","resolution":{"observed_at":"2026-08-07T12:44:05.548782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.331487Z","title":"Neuroncap: Photorealistic closed-loop safety testing for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.331487Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f9d72f8027c4c58391172fe478f3a0f77d342af1c09ca689d8dde1310b97e974","observation_id":"a0da2bbe-dcf4-4da6-ba34-a4f65753fcff","resolution":{"observed_at":"2026-08-07T12:43:56.331487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11037","last_updated":"2021-10-25T08:08:25Z","snapshot_observed_at":"2026-08-12T22:32:14.288125Z","submitted_at":"2021-06-21T12:28:08Z","title":"One Million Scenes for Autonomous Driving: ONCE Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11037","snapshot_observed_at":"2026-08-07T12:43:56.359232Z","title":"One million scenes for autonomous driving: Once dataset.arXiv preprint arXiv:2106.11037, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.359232Z"},"links":{"cited_paper":"/paper/2106.11037","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:835532c80b13fa17b028d26db7192488edb1b9eddaa05fbe72632b42ac7fe78c","observation_id":"8f331ab6-1af1-49d9-bd5a-9f09b1801d9a","resolution":{"observed_at":"2026-08-07T12:43:56.359232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.208921Z","title":"The mapil- lary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"a973edd1-a3fc-4056-82a8-99f19b39955b","year":2017},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.425385Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:a865837c15a714ef86734c7370c7aa34845d98f9262df884cb34a5d7671de4cb","observation_id":"4041c266-621c-42d7-8e48-fba32bc83a06","resolution":{"observed_at":"2026-08-07T12:44:05.295738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.466434Z","title":"Reason2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.466434Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:72c93102115104dc2938deea2578bea9b61fb223c7395dd95a97721c8896c0bf","observation_id":"377628ad-4d54-44f5-8214-9642b75d28cb","resolution":{"observed_at":"2026-08-07T12:43:56.466434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.911382Z","title":"Lost and found: detecting small road hazards for self-driving vehicles","venue":null,"work_id":"5a61a212-5ce7-4dc6-8215-cbbea8f8cba2","year":2016},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.494282Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f88ed8f27986fa620fbc64630a47b9c28ddbe20a21afafb2d3612dbd01968f77","observation_id":"389c19ae-5645-4c05-908d-0cc03e313712","resolution":{"observed_at":"2026-08-07T12:44:04.991770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.772917Z","title":"Multi-modal fusion transformer for end-to-end autonomous driving","venue":null,"work_id":"e50be613-4761-4fc6-83c4-d15378d6e09e","year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.534206Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:61e3a1851d8b5abda19318a02f9abf76eed359b0ddf6b2f9578e829e2b1a9610","observation_id":"0499c0e7-4f10-46b7-a299-020ad10c332a","resolution":{"observed_at":"2026-08-07T12:44:04.841677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.661252Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"ad4a80d8-1916-4b5f-8a73-7df25a289f29","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.578100Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d471aa24134132db6d53a8eec8230361c3222213bf395c2f8e0595f172d32d00","observation_id":"97962e97-d92c-4f8e-984b-a80e9762097c","resolution":{"observed_at":"2026-08-07T12:44:04.727691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00284","last_updated":"2025-09-13T19:54:45Z","snapshot_observed_at":"2026-08-10T10:19:32.316607Z","submitted_at":"2025-05-01T04:12:41Z","title":"LightEMMA: Lightweight End-to-End Multimodal Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00284","snapshot_observed_at":"2026-08-07T12:43:56.629156Z","title":"Lightemma: Lightweight end-to-end multimodal model for autonomous driving.arXiv preprint arXiv:2505.00284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.629156Z"},"links":{"cited_paper":"/paper/2505.00284","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:6b313207d1305f1765b86b5fd6ba4a67e10f30b7dd86b2d4c208cafab502805a","observation_id":"b99bcb2a-0662-426e-b7c8-9dccab1880b7","resolution":{"observed_at":"2026-08-07T12:43:56.629156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03026","last_updated":"2025-04-15T03:45:30Z","snapshot_observed_at":"2026-08-13T22:49:57.954752Z","submitted_at":"2023-10-04T17:59:49Z","title":"LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03026","snapshot_observed_at":"2026-08-07T12:43:56.671998Z","title":"Languagempc: Large language mod- els as decision makers for autonomous driving.arXiv preprint arXiv:2310.03026, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.671998Z"},"links":{"cited_paper":"/paper/2310.03026","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:dd0e0966e20fbaeb52e81ea289fd9038e70ed533901810b8b484b1f5a3c01bfe","observation_id":"5baf5823-14b8-44c1-9e4f-11da0a087384","resolution":{"observed_at":"2026-08-07T12:43:56.671998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.725639Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.725639Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:35b07a08f8e5a4e57217a39bf94cb3cb1a32b497704d6ff546b6a1818545a495","observation_id":"c959f8f4-9225-4e74-a87d-850c9559fbe2","resolution":{"observed_at":"2026-08-07T12:43:56.725639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.754304Z","title":"Reasonnet: End-to-end driving with temporal and global reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.754304Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:9242aec2489c655aadbe98f745a986276bb33795c734a188c79c5b2f8e092401","observation_id":"06d11cc3-e510-48b2-b56c-3f6bd2a80e7f","resolution":{"observed_at":"2026-08-07T12:43:56.754304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.789276Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.789276Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:fe6cd594d8b85f949ed62aacff9b634a370df47a2645e2671956ed2267d5f073","observation_id":"a5e9a7e2-7ccc-4ab9-a62c-0b6a9c4c1180","resolution":{"observed_at":"2026-08-07T12:43:56.789276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-13T04:55:49.773157Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-07T12:43:56.830698Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.830698Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:fa1e3a65d073ee25d8ed547ed18d81424d5b43b6fb9a8f520c4fd1bea9976ea1","observation_id":"693779d1-1163-444d-9fa1-52bc156838c0","resolution":{"observed_at":"2026-08-07T12:43:56.830698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.871535Z","title":"Insightdrive: Insight scene representation for end-to-end autonomous driving.arXiv preprint arXiv:2503.13047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.871535Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:5c11112c2950fa64d2e757d87a73431a97d75025c2f338c0fb6493f978d04f32","observation_id":"faf08ad7-6753-4a9d-9fab-24146458e038","resolution":{"observed_at":"2026-08-07T12:43:56.871535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:56.922519Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:56.922519Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:9127c0b33f2e24109dbdbd5447d0693d44ecc7fc55cbd190e4bedc7275ab9278","observation_id":"83099bf8-25bf-4237-9a25-d55124355e34","resolution":{"observed_at":"2026-08-07T12:43:56.922519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04942","last_updated":"2024-01-10T05:38:48Z","snapshot_observed_at":"2026-08-13T04:45:32.341794Z","submitted_at":"2024-01-10T05:38:48Z","title":"Latency-aware Road Anomaly Segmentation in Videos: A Photorealistic Dataset and New Metrics","version":1},"cited_work":{"arxiv_id":"2401.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04942","snapshot_observed_at":"2026-08-07T12:44:00.868695Z","title":"Latency-aware Road Anomaly Segmentation in Videos: A Photorealistic Dataset and New Metrics","venue":"cs.CV","work_id":"46268791-0688-4874-a6fe-4eeaa3f9b97a","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.001005Z"},"links":{"cited_paper":"/paper/2401.04942","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:66d889fd604991e7d66049b1d47986bacc8a1e85ff60db543c9a9260d5c8083f","observation_id":"f9e89ca9-19a1-4480-ab14-5b7d33608605","resolution":{"observed_at":"2026-08-07T12:44:01.240050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.360006Z","title":"Unsuper- vised road anomaly detection with language anchors","venue":null,"work_id":"9b5840a7-c2c3-48e0-9ef6-caf7f7153f91","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.052492Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f6a321cef27d279d6240e49b59874480b524307b95ecb41184c6c3a7076a8571","observation_id":"24c18685-4ae7-4b05-9f51-2a61d2161c10","resolution":{"observed_at":"2026-08-07T12:44:04.444659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-07T12:43:57.109906Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models.arXiv preprint arXiv:2402.12289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.109906Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:72e185d17d7596423177705b4438136828269cffacb4508a15fa40f0b4a36fa7","observation_id":"3bb042aa-f010-41af-9d31-dfffc72f96d8","resolution":{"observed_at":"2026-08-07T12:43:57.109906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.202382Z","title":"Idd: A dataset for exploring problems of autonomous navigation in unconstrained environments","venue":null,"work_id":"c9be97c6-86e3-41c2-9b71-3862667489b7","year":2019},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.172552Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:1ee807be3b3268db61ebe2dbef36be415b6576cb2095b2f4f349197905e530b8","observation_id":"20605ac9-5371-4d48-819f-a689e83e7f7d","resolution":{"observed_at":"2026-08-07T12:44:04.255625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.268097Z","title":"He-drive: Human-like end-to-end driving with vision language models.arXiv preprint arXiv:2410.05051, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.268097Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:af80283d008d32cd11e7a5e47848a54a2b47b6c34deaa7b206593429848077dc","observation_id":"d99dcaf8-c3b3-465f-a08e-c7de6f248c2e","resolution":{"observed_at":"2026-08-07T12:43:57.268097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-14T09:45:48.864445Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-07T12:43:57.368095Z","title":"Omnidrive: A holistic llm-agent framework for autonomous driving with 3d perception, reasoning and planning.arXiv preprint arXiv:2405.01533, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.368095Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:813de739d3300196d494fe5915bc8fce18b6242585a1906b564b52023446a714","observation_id":"02d85934-b385-458d-8073-fbc9b35054cc","resolution":{"observed_at":"2026-08-07T12:43:57.368095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16996","last_updated":"2024-03-25T17:59:01Z","snapshot_observed_at":"2026-08-13T00:45:25.533602Z","submitted_at":"2024-03-25T17:59:01Z","title":"DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16996","snapshot_observed_at":"2026-08-07T12:43:57.433245Z","title":"Drivecot: Integrating chain-of-thought reasoning with end-to-end driving.arXiv preprint arXiv:2403.16996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.433245Z"},"links":{"cited_paper":"/paper/2403.16996","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:60a2e3ff7ca5690c0a4fff2bf7bf711b51a3a38d9b6f754524f1bc2cad24dc2a","observation_id":"85d3ba32-1571-42fc-8847-ccbbefcaa5e2","resolution":{"observed_at":"2026-08-07T12:43:57.433245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T12:43:57.480708Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.480708Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d53ece5141423861e12edebdc5f7f991c46685d382b9ee4cd6cf77399415accc","observation_id":"430c93e9-6093-44ab-81c8-58fd54fe7e6c","resolution":{"observed_at":"2026-08-07T12:43:57.480708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.526427Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for autonomous driving.arXiv preprint arXiv:2312.09245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.526427Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:3634c5b7e3c27defd1572304e08f6e691f56e53531b9366b7c029f4d100d8505","observation_id":"1ef3c976-2370-40b6-979c-f3cebf2f98a5","resolution":{"observed_at":"2026-08-07T12:43:57.526427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:57.558191Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.558191Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:e657b038597ad9c1195bf9d6f7476bae3a09e1141008731c7e2c4dfbaacaa71e","observation_id":"97b848ce-e774-4d42-8097-81e73afa3e3b","resolution":{"observed_at":"2026-08-07T12:43:57.558191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.048505Z","title":"Editable scene simulation for autonomous driving via collaborative llm-agents","venue":null,"work_id":"2c9d7d0b-b542-4d1c-ab4b-1c4a8236c5cb","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.602657Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:81910f03bdcdc97fb337d7dc9e2c81f92d3b54aba782b1414d2649f6004efae1","observation_id":"d689afab-634d-4c53-bb4b-845a0bdb152a","resolution":{"observed_at":"2026-08-07T12:44:04.075517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.904372Z","title":"Para-drive: Parallelized architecture for real-time autonomous driving","venue":null,"work_id":"417d1823-1650-46ec-98db-2de17d2da57f","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.667441Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:b77476a083d42a795107df122d7b663b64db13d76736e975de1054c6acc3381d","observation_id":"4d728ed0-ecb4-4c05-b480-82fef08963d9","resolution":{"observed_at":"2026-08-07T12:44:03.980566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00493","last_updated":"2023-01-02T00:36:22Z","snapshot_observed_at":"2026-08-12T21:55:36.747659Z","submitted_at":"2023-01-02T00:36:22Z","title":"Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00493","snapshot_observed_at":"2026-08-07T12:43:57.720414Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting.arXiv preprint arXiv:2301.00493, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.720414Z"},"links":{"cited_paper":"/paper/2301.00493","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c0cc24e46c63ec5a5013e62610a8799b864202484750fe6b673d8487cabf5ca4","observation_id":"ba8538fc-a862-4b1f-8967-f28846f4bbcb","resolution":{"observed_at":"2026-08-07T12:43:57.720414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.703744Z","title":"Referring multi-object tracking","venue":null,"work_id":"e21d20e8-554d-44bc-b226-26464d2d5a91","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.835861Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:2f16f1ea054db46148dc063b1db627b987a6f0c64110f26246916d14445cb5d6","observation_id":"d94c9351-d47f-424a-82a6-98a1e87f28d7","resolution":{"observed_at":"2026-08-07T12:44:03.768803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04379","last_updated":"2025-03-30T15:11:24Z","snapshot_observed_at":"2026-08-13T10:17:49.877034Z","submitted_at":"2023-09-08T15:21:07Z","title":"Language Prompt for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04379","snapshot_observed_at":"2026-08-07T12:43:57.928597Z","title":"Language prompt for autonomous driving.arXiv preprint arXiv:2309.04379, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:57.928597Z"},"links":{"cited_paper":"/paper/2309.04379","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:a042bdb62c26cfe5b64ebbd18e53b0bee7392d4ea5e4b57cb967dced118581ca","observation_id":"d4d4728f-31d8-4f3d-9841-ad1047878d71","resolution":{"observed_at":"2026-08-07T12:43:57.928597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T12:43:58.005230Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.005230Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:f22a0c3d0b635a2659cd56b6b969e4f085b0843253b3bbf8a8f166400f814f4b","observation_id":"ea3c4b07-d452-49e2-a25b-f1f07e9be472","resolution":{"observed_at":"2026-08-07T12:43:58.005230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.502959Z","title":"Mars: An instance-aware, modular and realistic simulator for autonomous driving","venue":null,"work_id":"ffeb9393-8202-4fa5-a049-713be97431ae","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.078421Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:ace09014b4a56e9da27d24c445a8995d16e84d349bc4914c2f371c432c6c77d9","observation_id":"545dd546-060c-4c70-8f3a-d66925eed465","resolution":{"observed_at":"2026-08-07T12:44:03.597040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.365681Z","title":"Synthesize then compare: Detecting failures and anomalies for semantic segmentation","venue":null,"work_id":"6a6440d0-214f-4504-a343-6f5fde45529e","year":2020},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.158410Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:482280ee878cb5f02ffc04a7a9481706097f54051bb9e2a7014fa4b4f1b60461","observation_id":"76fdfeaa-9f5e-4d9e-8cf1-77c349b835c6","resolution":{"observed_at":"2026-08-07T12:44:03.413123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-14T06:26:44.353267Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04003","snapshot_observed_at":"2026-08-07T12:43:58.249021Z","title":"Are vlms ready for autonomous driving? an empirical study from the reliability, data, and metric perspectives.arXiv preprint arXiv:2501.04003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.249021Z"},"links":{"cited_paper":"/paper/2501.04003","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c90e9ebc6752b1037aaaf33cf71e69fe6f5313ec1994abd378d324b7e88f44fc","observation_id":"059b7124-7226-493f-a978-a95d81149207","resolution":{"observed_at":"2026-08-07T12:43:58.249021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:58.324744Z","title":"Openemma: Open-source multimodal model for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.324744Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:a9607e9f033c8191ec117bfc9622bdd822194927fedbe4f2d0d640f0bdbb064e","observation_id":"4941784e-7c03-4e07-b97e-785daa6cd89f","resolution":{"observed_at":"2026-08-07T12:43:58.324744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14446","last_updated":"2025-08-29T20:50:08Z","snapshot_observed_at":"2026-08-14T06:30:40.348532Z","submitted_at":"2024-12-19T01:53:36Z","title":"VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14446","snapshot_observed_at":"2026-08-07T12:43:58.375796Z","title":"Vlm-ad: End-to-end autonomous driving through vision-language model supervision.arXiv preprint arXiv:2412.14446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.375796Z"},"links":{"cited_paper":"/paper/2412.14446","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:c65ae9e8b9907d3d69777f16afa2b722be402c8a1a42c1ea1f3de2cbd75b6f26","observation_id":"ea5a87f9-cdc6-4251-a157-ce6bb2de8908","resolution":{"observed_at":"2026-08-07T12:43:58.375796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-08-14T15:08:11.904523Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-07T12:43:58.419590Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model.arXiv preprint arXiv:2310.01412, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.419590Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:0d9fd96bd8860f86dd9fb591ae6b36b4985285b5ab7d497ee849e34f819a7d8a","observation_id":"6ef35f2a-677a-47a8-ae7b-469e6e68eb71","resolution":{"observed_at":"2026-08-07T12:43:58.419590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15880","last_updated":"2025-05-23T02:48:27Z","snapshot_observed_at":"2026-08-13T11:30:44.263791Z","submitted_at":"2025-05-21T17:59:55Z","title":"Challenger: Affordable Adversarial Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15880","snapshot_observed_at":"2026-08-07T12:43:58.489169Z","title":"Challenger: Affordable adversarial driving video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.489169Z"},"links":{"cited_paper":"/paper/2505.15880","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d15d5d430f6b55c26e3f5db669d3ca01f6a87807e80525f5dd98ea6e93a5f054","observation_id":"ef68b084-f74a-4044-b7b7-dea1cf3cc0b7","resolution":{"observed_at":"2026-08-07T12:43:58.489169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.206175Z","title":"Int2: Interactive trajectory prediction at intersections","venue":null,"work_id":"957c20df-4ea1-4d03-9978-b5d6314f815d","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.603947Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:67e753f00390982f458695647b6646277f9711803aebf029ed43f964edd35521","observation_id":"78fee9cf-bb96-4b43-81b7-9327e759c11b","resolution":{"observed_at":"2026-08-07T12:44:03.257750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T12:43:58.636454Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.636454Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:2a4e33e809886cb2a21f52a4ba679c77c46e3af839e5e44e82ab45ce92aeae33","observation_id":"d3dce658-4871-464d-94a0-4872dff88539","resolution":{"observed_at":"2026-08-07T12:43:58.636454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14182","last_updated":"2025-03-18T11:57:31Z","snapshot_observed_at":"2026-08-10T09:56:09.299157Z","submitted_at":"2025-03-18T11:57:31Z","title":"Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14182","snapshot_observed_at":"2026-08-07T12:43:58.705723Z","title":"Bridging past and future: End-to-end autonomous driving with historical prediction and planning.arXiv preprint arXiv:2503.14182, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.705723Z"},"links":{"cited_paper":"/paper/2503.14182","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:fbb2b6c644dc205fdd2a2d63cf5ad57f134181295e1abf301bc89ea722b09627","observation_id":"2ef1d802-3bc4-45aa-bb04-09e5aa708757","resolution":{"observed_at":"2026-08-07T12:43:58.705723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06892","last_updated":"2024-04-10T10:34:34Z","snapshot_observed_at":"2026-08-14T22:26:10.381037Z","submitted_at":"2024-04-10T10:34:34Z","title":"SparseAD: Sparse Query-Centric Paradigm for Efficient End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06892","snapshot_observed_at":"2026-08-07T12:43:58.778472Z","title":"Sparsead: Sparse query- centric paradigm for efficient end-to-end autonomous driving.arXiv preprint arXiv:2404.06892, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.778472Z"},"links":{"cited_paper":"/paper/2404.06892","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d641a09e51f72bbcc3e564f61a7d37c8ef02347a92c747485a673e6b9097eae2","observation_id":"a5b8b443-997a-4739-9a06-d79bbe3ee7d5","resolution":{"observed_at":"2026-08-07T12:43:58.778472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.946080Z","title":"End-to-end urban driving by imitating a reinforcement learning coach","venue":null,"work_id":"1bd43029-afa2-4a78-ad60-1bed0bf88eef","year":2021},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.818892Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:d1f1aa4fc70d245f2834a36b260fbfc21884288dce70325e6fdca4bf3cb4dabb","observation_id":"c4ee4bae-a33b-45ae-b8a8-9b5e6a8433dc","resolution":{"observed_at":"2026-08-07T12:44:03.049311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11502","last_updated":"2024-04-07T02:42:27Z","snapshot_observed_at":"2026-08-14T13:00:19.917526Z","submitted_at":"2024-02-18T08:21:05Z","title":"GenAD: Generative End-to-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11502","snapshot_observed_at":"2026-08-07T12:43:58.842298Z","title":"Genad: Genera- tive end-to-end autonomous driving.arXiv preprint arXiv:2402.11502, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.842298Z"},"links":{"cited_paper":"/paper/2402.11502","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:be0b9cd622e6f7af25f283412ff183709274d81f714ea9056574a678e5d85c6d","observation_id":"e5ef869a-43b2-4f14-b556-ea1b16459bec","resolution":{"observed_at":"2026-08-07T12:43:58.842298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.751503Z","title":"Monoocc: Digging into monocular semantic occupancy prediction","venue":null,"work_id":"18d39874-f5c8-4d1b-aeb4-ee468aee0c28","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.878471Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:7fb70c99ca32c573e198c81ef3bfd0c1b4e9b77636d8d79fe103b36841e6f685","observation_id":"b9df9886-45c5-491a-9e2d-cceedb4add23","resolution":{"observed_at":"2026-08-07T12:44:02.875702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:02.536277Z","title":"Steps: Joint self-supervised nighttime image enhancement and depth estimation","venue":null,"work_id":"eb1de31a-386d-46d5-9e72-d684d976c51b","year":2023},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.919800Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:917e06a814b982fc5ce9eb360eda5785b4de87d1c27b23328d0a9fa0abb97d99","observation_id":"1428ab8d-d32d-4d65-8563-e8e168829ebc","resolution":{"observed_at":"2026-08-07T12:44:02.643517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.13076","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:43:59.467234Z","title":"Hints of prompt: Enhancing visual representation for multimodal llms in autonomous driving.arXiv preprint arXiv:2411.13076, 2024","venue":null,"work_id":"493b71a0-9681-4485-8cf5-8cf906735111","year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.952462Z"},"links":{"citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:5dfaa4dbafccbb4434cc3e13f94f4e7ca3cceb21dda88aa8d952d1b651fed4ff","observation_id":"2bca0cde-2dad-4c8b-982e-b9facfa11447","resolution":{"observed_at":"2026-08-07T12:43:59.539208Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04593","last_updated":"2024-03-07T15:39:18Z","snapshot_observed_at":"2026-08-15T02:14:18.546448Z","submitted_at":"2024-03-07T15:39:18Z","title":"Embodied Understanding of Driving Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04593","snapshot_observed_at":"2026-08-07T12:43:58.997932Z","title":"unstructured","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:58.997932Z"},"links":{"cited_paper":"/paper/2403.04593","citing_paper":"/paper/2505.23757"},"observation_digest":"sha256:a3c5096cbe07d86deff18779992abb07d7708e2080b52438f48d1182b43875ed","observation_id":"c4cdcc59-5205-4585-b33a-c833d043cbc0","resolution":{"observed_at":"2026-08-07T12:43:58.997932Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23757","last_updated":"2025-05-29T17:59:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:31:22.166993Z","submitted_at":"2025-05-29T17:59:46Z","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 29 inbound Pith citation observations for arXiv:2505.23757."}