{"as_of":"2026-08-10T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b92f51cc3d43593b2331245ae0e3e799cbb4d22863feb478ded4c343366af772","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:32:33.879692Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02659/citation-record","integrity":"/paper/2509.02659/integrity","json":"/paper/2509.02659/citation-record.json","paper":"/paper/2509.02659"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:32:34.467638Z","title":null,"venue":null,"work_id":"2d078ed5-a398-4727-abf4-f41d24d5d12e","year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:31.559993Z"},"links":{"citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:774695ff70f309e1e9c605669e3c330deb107ff18e3bd35180d5861ee90cb2b9","observation_id":"3a9f5354-ac8e-4e6d-8ef6-0d7ebe59e43a","resolution":{"observed_at":"2026-08-05T11:32:34.471632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11810","last_updated":"2022-02-04T02:50:02Z","snapshot_observed_at":"2026-08-09T09:38:45.203903Z","submitted_at":"2021-06-22T14:24:55Z","title":"NuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11810","snapshot_observed_at":"2026-08-05T11:32:31.628690Z","title":"nuplan: A closed-loop ml-based plan- ning benchmark for autonomous vehicles","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:31.628690Z"},"links":{"cited_paper":"/paper/2106.11810","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:eb83c596b074010d8aeaddf5a1ef5093ca16c65615136e8f6e812ac7c3c6e197","observation_id":"02388aba-8ea0-45d3-b5fa-5791db777058","resolution":{"observed_at":"2026-08-05T11:32:31.628690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T11:32:31.709766Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:31.709766Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:24c4326655ce48dc37a6d4d5219d511d597bc314c5977b234840d76a1c0e16cb","observation_id":"77c316b4-fe87-4df9-8bc9-63ab4c6561bc","resolution":{"observed_at":"2026-08-05T11:32:31.709766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-05T11:32:31.784450Z","title":"Vadv2: End-to-end vectorized autonomous driving via probabilistic planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:31.784450Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:034391594303ad25e363eae47d93e2924b6894882c1c12162062e476d341ab9a","observation_id":"477b43a1-033b-4aa7-81e0-1f3261d74f2a","resolution":{"observed_at":"2026-08-05T11:32:31.784450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00988","last_updated":"2024-01-02T01:54:22Z","snapshot_observed_at":"2026-08-07T02:32:15.743629Z","submitted_at":"2024-01-02T01:54:22Z","title":"Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00988","snapshot_observed_at":"2026-08-05T11:32:31.855904Z","title":"Holistic autonomous driving un- derstanding by bird’s-eye-view injected multi-modal large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:31.855904Z"},"links":{"cited_paper":"/paper/2401.00988","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:675cb27479f91b620d7d375d8e3d269f524c593a2741c33dcd11f71a0bcaf887","observation_id":"a5133449-9421-44f0-897a-2d55ab222cd7","resolution":{"observed_at":"2026-08-05T11:32:31.855904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T11:32:31.953341Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:31.953341Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:6bf66ae1abccfd189da64e95d97710dab1a4ec32a29b5e51ef467393e0d96782","observation_id":"3d42378f-e409-4dac-87f8-d0cfbd615ab6","resolution":{"observed_at":"2026-08-05T11:32:31.953341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-07T02:31:28.236732Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-05T11:32:32.036400Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.036400Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:06ca653e020eb1ea45e53afc0800311f27548d754456b29c248acf1ebc6b81ba","observation_id":"06ab3517-4173-48b2-b5be-f9290b318fe4","resolution":{"observed_at":"2026-08-05T11:32:32.036400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-05T11:32:32.129986Z","title":"Gaia-1: A generative world model for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.129986Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:77d9130c80fa43a08a8236cbe1272288e44f2b6505b1fc5872c9c027d2d1ed31","observation_id":"1101ea54-1eb7-4f1d-81bf-39fc1ceaec5a","resolution":{"observed_at":"2026-08-05T11:32:32.129986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:32:32.184781Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.184781Z"},"links":{"citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:5a7647a1f87890f0b93c43c2d62afda966418664c3ed99701efbeccb660cf3b6","observation_id":"f41b8a38-698d-4cba-9848-336cf8ad9707","resolution":{"observed_at":"2026-08-05T11:32:32.184781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:32:34.442650Z","title":"St-p3: End-to-end vision-based au- tonomous driving via spatial-temporal feature learning","venue":null,"work_id":"d077fdea-9b6f-46ab-961e-5d553fa58c3b","year":2022},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.248486Z"},"links":{"citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:9e7b39811598eb845edeb89680490904ddfdbd1385caefb949bc66638c4b08e4","observation_id":"eb01318a-20cd-47b2-afde-0cbba74be661","resolution":{"observed_at":"2026-08-05T11:32:34.447567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:32:34.426115Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"01c6bbdf-0399-40df-9ccf-df30a54428f6","year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.365866Z"},"links":{"citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:b5732f7a96a0b858e86032ab104fe883d6fb95305cd1ead4e32a747f4ca1a728","observation_id":"55565ac0-998b-4514-9659-3c7a82ad8bb9","resolution":{"observed_at":"2026-08-05T11:32:34.432515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07771","last_updated":"2023-10-11T18:00:08Z","snapshot_observed_at":"2026-08-01T02:20:23.247164Z","submitted_at":"2023-10-11T18:00:08Z","title":"DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07771","snapshot_observed_at":"2026-08-05T11:32:32.477461Z","title":"Drivingdif- fusion: Layout-guided multi-view driving scene video generation with latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.477461Z"},"links":{"cited_paper":"/paper/2310.07771","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:f68732e101a63188fdb624eac01344462af68fd37b0c1f9236284f01b5954bc4","observation_id":"ff799187-915a-4601-bfb4-1f3da55b9c8a","resolution":{"observed_at":"2026-08-05T11:32:32.477461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02934","last_updated":"2024-08-08T04:42:52Z","snapshot_observed_at":"2026-07-06T16:57:17.747414Z","submitted_at":"2023-12-05T18:05:14Z","title":"WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02934","snapshot_observed_at":"2026-08-05T11:32:32.658188Z","title":"Wovogen: World volume-aware diffusion for controllable multi-camera driving scene generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.658188Z"},"links":{"cited_paper":"/paper/2312.02934","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:2388865baf043f601994f0f56f62a1cceb0492b759000d6af6c3522eeaac8660","observation_id":"dbbd1cc0-788a-47f1-b997-b00c4160468e","resolution":{"observed_at":"2026-08-05T11:32:32.658188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-05T11:32:32.772087Z","title":"Gpt-driver: Learning to drive with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.772087Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:4e823b79539b1db02faf4d856cdaf5dc8c9fe5ffae4f519f08b45513834c0452","observation_id":"2b6e33bd-1fe5-4d78-b65a-c65dd6c276dc","resolution":{"observed_at":"2026-08-05T11:32:32.772087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10813","last_updated":"2024-07-28T23:37:51Z","snapshot_observed_at":"2026-08-09T11:49:35.152299Z","submitted_at":"2023-11-17T18:59:56Z","title":"A Language Agent for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10813","snapshot_observed_at":"2026-08-05T11:32:32.889451Z","title":"A language agent for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:32.889451Z"},"links":{"cited_paper":"/paper/2311.10813","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:7bdd8c6c37dd17f280edc7eb46fc5cec6a98cbccc77de9498add78abbfafbc2c","observation_id":"a2d0feb9-2402-4a2e-8873-ef91e037f8c5","resolution":{"observed_at":"2026-08-05T11:32:32.889451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07488","last_updated":"2023-12-21T05:37:58Z","snapshot_observed_at":"2026-08-09T23:15:47.987611Z","submitted_at":"2023-12-12T18:24:15Z","title":"LMDrive: Closed-Loop End-to-End Driving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07488","snapshot_observed_at":"2026-08-05T11:32:33.037882Z","title":"Lmdrive: Closed-loop end- to-end driving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.037882Z"},"links":{"cited_paper":"/paper/2312.07488","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:f8142c80f284cd0af96785f33cdabbe34c6ceeb8ba92b22785d9b82bb2dd017b","observation_id":"7c8d7078-2c7b-4cad-a178-ced6218b842c","resolution":{"observed_at":"2026-08-05T11:32:33.037882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-10T19:14:31.295716Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-05T11:32:33.177237Z","title":"Drivelm: Driving with graph visual ques- tion answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.177237Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:9b7cdd33141024030436406f9be5d8989c53724a2f49affc3b77c725e04eb28b","observation_id":"b2ae9594-cad5-49bd-9a16-a76fed16ae4f","resolution":{"observed_at":"2026-08-05T11:32:33.177237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-10T03:38:23.239399Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-05T11:32:33.325982Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.325982Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:5bb1bf7d2dda3a92b7b97ebe4835eacc611e38d9091762e01c6ee6eac3e9e41e","observation_id":"2179ba5a-0dac-4d84-bbfa-adf14a5408c1","resolution":{"observed_at":"2026-08-05T11:32:33.325982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T11:32:33.394298Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.394298Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:3e33f711065e3229df778508bb8651bec83e32308cf75d6d79c5d03844c0729c","observation_id":"7ae66473-ab6e-4ae1-9747-d44bb5680f2f","resolution":{"observed_at":"2026-08-05T11:32:33.394298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-07T03:24:13.032388Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-05T11:32:33.451445Z","title":"Omnidrive: A holistic llm-agent framework for autonomous driving with 3d perception, reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.451445Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:956ada99438f5067a9a43a0cbf3cab308d9a35babdd383df52a99d7808835172","observation_id":"ea714b6e-32d4-4fbe-ba32-9d22e10bc6f7","resolution":{"observed_at":"2026-08-05T11:32:33.451445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:32:33.511426Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.511426Z"},"links":{"citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:b392703e51075ea91788707661d1d48c5fd13d4e7a70fcaf22dac356c9e4151b","observation_id":"9662b523-70cd-4b18-b8de-b4088bb281fd","resolution":{"observed_at":"2026-08-05T11:32:33.511426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17918","last_updated":"2023-11-29T18:59:47Z","snapshot_observed_at":"2026-08-09T13:02:43.855961Z","submitted_at":"2023-11-29T18:59:47Z","title":"Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17918","snapshot_observed_at":"2026-08-05T11:32:33.582916Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.582916Z"},"links":{"cited_paper":"/paper/2311.17918","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:55b486891830336c8bf904a65e1e1f133b81d6a4dfab2c89d0074dfb76bd39d9","observation_id":"6479f533-0276-4b16-ae5e-c90d51c72f15","resolution":{"observed_at":"2026-08-05T11:32:33.582916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-08-09T15:49:58.636852Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-05T11:32:33.666881Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.666881Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:1e0f931b1e1b620ff88666dbf23da1a6b7b8bd1dc428d327253835c2fde21f6c","observation_id":"b37e2534-9a3c-4119-a971-7c5fd99e9bab","resolution":{"observed_at":"2026-08-05T11:32:33.666881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09630","last_updated":"2024-08-08T11:38:21Z","snapshot_observed_at":"2026-08-04T16:05:23.092640Z","submitted_at":"2024-03-14T17:58:33Z","title":"GenAD: Generalized Predictive Model for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09630","snapshot_observed_at":"2026-08-05T11:32:33.747271Z","title":"Generalized predictive model for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.747271Z"},"links":{"cited_paper":"/paper/2403.09630","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:a686a2a95ed296b93bc01a3259ed57c594ef6e00ba5566fc04168b20c398d4c5","observation_id":"941b6ca7-1a71-4991-8db2-71c21777da0d","resolution":{"observed_at":"2026-08-05T11:32:33.747271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19098","last_updated":"2024-04-07T03:49:39Z","snapshot_observed_at":"2026-07-06T17:52:18.041492Z","submitted_at":"2024-03-28T02:22:28Z","title":"GraphAD: Interaction Scene Graph for End-to-end Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19098","snapshot_observed_at":"2026-08-05T11:32:33.826657Z","title":"Graphad: Interaction scene graph for end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.826657Z"},"links":{"cited_paper":"/paper/2403.19098","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:71467d0696292715f0273142fef1d67a3e70f65b8023679596a92094a4ee69fd","observation_id":"824d40cc-f742-4dd8-b044-8fde1d28e71a","resolution":{"observed_at":"2026-08-05T11:32:33.826657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06845","last_updated":"2024-04-11T04:17:13Z","snapshot_observed_at":"2026-08-10T11:10:27.786453Z","submitted_at":"2024-03-11T16:03:35Z","title":"DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06845","snapshot_observed_at":"2026-08-05T11:32:33.879692Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:32:33.879692Z"},"links":{"cited_paper":"/paper/2403.06845","citing_paper":"/paper/2509.02659"},"observation_digest":"sha256:f54185ae45b743eb9ef792a380c8a180d460d4fcd782f2156e147b55b41e9993","observation_id":"6eadc52c-e9ad-4945-9c71-f6e2e3c7f6fd","resolution":{"observed_at":"2026-08-05T11:32:33.879692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02659","last_updated":"2025-09-02T17:52:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:39:22.286238Z","submitted_at":"2025-09-02T17:52:29Z","title":"2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2509.02659."}