{"as_of":"2026-08-14T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99df42cf7c6b0b859b593fc9a2171e71f6051858d100e382570c0e695ef2009a","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:35:17.480171Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:54.573103Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:08:03.455156Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-08-07T14:02:54.573103Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-14T01:14:39.568702Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.573103Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:db67f554a4d7f5715b17055dd9759f020511829ff0599198b6f75aee9dccb73a","observation_id":"b31184b9-f863-4bba-9aa7-5523647c443b","resolution":{"observed_at":"2026-08-07T14:02:54.573103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-08-14T00:40:02.694887Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-14T21:46:43.955825Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2506.13757"},"observation_digest":"sha256:9a8b92c4352ab557c8898d57b8bbffe33e617604e8c7cf7e82323d63a9542d46","observation_id":"b81e7337-aced-4e00-a817-1454e2c7d709","resolution":{"observed_at":"2026-05-14T21:46:44.143405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2604.00813","last_updated":"2026-04-24T15:37:17Z","snapshot_observed_at":"2026-08-10T21:44:04.016382Z","submitted_at":"2026-04-01T12:21:26Z","title":"DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-13T22:59:57.744015Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2604.00813"},"observation_digest":"sha256:3f62d1632076e1e2a37845066919d6f3d5ed4fd47dde543d7e47103dfe317192","observation_id":"9892e3a9-571d-4b26-9671-3812f91da7bb","resolution":{"observed_at":"2026-05-13T23:03:25.066904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2604.04857","last_updated":"2026-04-06T17:02:06Z","snapshot_observed_at":"2026-08-11T14:55:44.030787Z","submitted_at":"2026-04-06T17:02:06Z","title":"The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T20:04:46.144856Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2604.04857"},"observation_digest":"sha256:3929059d49dfebae81cac8f08994e8029508b0c298c0156294429972259c6cbf","observation_id":"0daa3f72-1ea6-4a43-ae00-ea9382f21466","resolution":{"observed_at":"2026-05-10T22:15:50.119001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2604.22260","last_updated":"2026-04-24T06:09:41Z","snapshot_observed_at":"2026-08-11T04:18:19.449565Z","submitted_at":"2026-04-24T06:09:41Z","title":"Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T12:37:17.646552Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2604.22260"},"observation_digest":"sha256:c80a3aa9eefdc8ebdc16344b812c5ee08631905693845ff9e3fc9d3a23dd09ab","observation_id":"665c548c-f329-45b4-a727-abbe34529c3d","resolution":{"observed_at":"2026-05-11T19:06:11.211754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2605.10564","last_updated":"2026-05-11T13:36:51Z","snapshot_observed_at":"2026-08-14T14:10:05.966393Z","submitted_at":"2026-05-11T13:36:51Z","title":"DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T04:13:37.421188Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2605.10564"},"observation_digest":"sha256:9a14f0f54c6195391212dcbcca3d0e1adb2d2c02c144b5777d16c8410587266b","observation_id":"ea951d77-167c-4181-8498-6d1dcb74d744","resolution":{"observed_at":"2026-05-12T06:31:26.091928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2605.20082","last_updated":"2026-05-19T16:36:34Z","snapshot_observed_at":"2026-08-14T14:29:56.735928Z","submitted_at":"2026-05-19T16:36:34Z","title":"VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:39:04.567741Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2605.20082"},"observation_digest":"sha256:3944aabebe8b61a8c8c1eb8edfccb254aaa3721498adba41410c6bcfa5dc16c4","observation_id":"3de3271e-acb4-42bf-b7e0-4e54a35120b7","resolution":{"observed_at":"2026-05-20T05:43:06.036435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2606.01624","last_updated":"2026-06-02T05:32:33Z","snapshot_observed_at":"2026-08-14T10:56:47.843869Z","submitted_at":"2026-06-01T03:18:01Z","title":"What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:36:25.219607Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2606.01624"},"observation_digest":"sha256:26c94b2cafc47451d2fe633ca685489983f47950441407bc9538fd508e60396b","observation_id":"56d2d32b-c206-4989-b4bf-c83d9d0ce7d1","resolution":{"observed_at":"2026-07-01T22:16:16.230998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2412.09951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-07-03T11:08:03.455156Z","title":"Wisead: Knowl- edge augmented end-to-end autonomous driving with vision-language model","venue":null,"work_id":"08bfc5a7-8b4c-4a27-8f02-5923a412f899","year":2024},"citing_paper":{"arxiv_id":"2606.12396","last_updated":"2026-06-10T17:57:06Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:57:06Z","title":"VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:51.407286Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2606.12396"},"observation_digest":"sha256:79fac534ae7dcd3d952be809dd3a72606a128d1da708d16928087a45908fd3d2","observation_id":"c3e7aca4-d184-4b78-ac52-2ce33e246204","resolution":{"observed_at":"2026-07-03T11:08:03.456655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-08-01T17:46:55.844970Z","title":"Zhang, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17521","last_updated":"2026-07-23T04:08:20Z","snapshot_observed_at":"2026-08-12T11:47:14.266857Z","submitted_at":"2026-07-20T03:56:07Z","title":"GeoWorldAD: Geometry World Action Model for Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:46:55.844970Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2607.17521"},"observation_digest":"sha256:588c8cd181422a6e6956ce2fc1e41a58273ed8dd798ab52e7a53fd141da1021c","observation_id":"b2937be0-0f76-486b-a91e-476d575d6336","resolution":{"observed_at":"2026-08-01T17:46:55.844970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09951","snapshot_observed_at":"2026-08-07T00:13:57.120069Z","title":"Wisead: Knowledge augmented end-to-end autonomous driving with vision-language model.arXiv preprint arXiv:2412.09951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01755","last_updated":"2026-08-04T02:59:32Z","snapshot_observed_at":"2026-08-13T13:43:12.484746Z","submitted_at":"2026-08-03T06:24:36Z","title":"Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:57.120069Z"},"links":{"cited_paper":"/paper/2412.09951","citing_paper":"/paper/2608.01755"},"observation_digest":"sha256:ed76493a6b20202946332df661c5ae0eecb25c4b8c56e360ba59b3932ec1fb42","observation_id":"ccac55f8-5bb8-43f1-bf0f-378109b7f667","resolution":{"observed_at":"2026-08-07T00:13:57.120069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09951/citation-record","integrity":"/paper/2412.09951/integrity","json":"/paper/2412.09951/citation-record.json","paper":"/paper/2412.09951"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.968534Z","title":"com/apolloauto/apollo, note = Accessed: 2019-02-","venue":null,"work_id":"e834e4a2-5ba9-4bc9-af99-1ef1c9ee653c","year":2017},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.304746Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:babf4e84d803fd23759b9dbd00aef4b2b6fcada9c6a383a4db36fdece0eff3e1","observation_id":"1880178c-caca-4d87-9ece-eb6aa29b50f1","resolution":{"observed_at":"2026-08-11T16:35:17.970919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.307896Z","title":"Covla: Comprehensive vision-language-action dataset for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.307896Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:d29d81abd8969824b77e4d829063b3d95c85074a7d2aef94472056e1e4a029fb","observation_id":"5b23e33b-4dd9-4be2-9a21-455f2c53c504","resolution":{"observed_at":"2026-08-11T16:35:17.307896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T16:35:17.310736Z","title":"Qwen-vl: A versatile vision-language model for understand- ing, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.310736Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:68ada0ebe9e9225a9856b1e4674bd4645e02a925632a85b11eb98543d75c3d18","observation_id":"14e060d5-c002-4196-b079-769bd05a095e","resolution":{"observed_at":"2026-08-11T16:35:17.310736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.962014Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":"0f0f62c7-a375-4b2a-afb3-32abc05e4be4","year":2020},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.313978Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:ddab2ec85387ff358b21ad3014ad8303e4dc2848c6acaf0b8317733543cd5aeb","observation_id":"622d331e-4400-4ed0-ac79-0956095c41be","resolution":{"observed_at":"2026-08-11T16:35:17.964185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.955837Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"df8cb9b3-2233-4cdb-b939-d901c79406bf","year":null},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.316825Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:2bf207294490b30f92464827e99d125f30877cf0f641bd06f1d27451c30dd778","observation_id":"645a9e7a-831b-44a3-b211-e3f35a9fae71","resolution":{"observed_at":"2026-08-11T16:35:17.958043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.949485Z","title":"Neat: Neural attention fields for end-to-end autonomous driving","venue":null,"work_id":"185a34ad-57bc-47dc-b451-be9b16fc430c","year":2021},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.319482Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:62cb8db1baca28f4821fc4c5a3c5bf28f29bff796738b142f4034985aeeaf7d5","observation_id":"e5a368d7-abb4-4eec-8b3d-3f4d2dcd6800","resolution":{"observed_at":"2026-08-11T16:35:17.951773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T16:35:17.321824Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.321824Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:67b5f6b780357fc89899a05ca1ac0ed568d544fb86b86318bb738dc107fea781","observation_id":"bcc2bcb6-62c1-4c08-9a1a-1b70aebde2e1","resolution":{"observed_at":"2026-08-11T16:35:17.321824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-11T16:35:17.324427Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.324427Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:5c74c7b1a35825f5ffca8552775afdfcb4fe7cfee787c2e3eff1534efd9418b2","observation_id":"0c86b0cd-f3a2-4af8-a5b5-890cb1b2e63b","resolution":{"observed_at":"2026-08-11T16:35:17.324427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.943471Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"2c7215aa-24f4-4941-836e-34c14e2d30ab","year":2016},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.327049Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:4ea93f1f490f1cd807e9542bce79686e1364c994701362e6155ac79f563a4d94","observation_id":"17fb9a6a-3a38-43fb-95bb-4bc160a48638","resolution":{"observed_at":"2026-08-11T16:35:17.945615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10838","last_updated":"2020-08-26T06:27:52Z","snapshot_observed_at":"2026-08-14T09:05:24.781092Z","submitted_at":"2019-09-24T12:29:27Z","title":"Talk2Car: Taking Control of Your Self-Driving Car","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10838","snapshot_observed_at":"2026-08-11T16:35:17.329129Z","title":"Talk2car: Taking con- trol of your self-driving car.arXiv preprint arXiv:1909.10838,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.329129Z"},"links":{"cited_paper":"/paper/1909.10838","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:90c06b7205fe99d023a3c42f1c31c47817d2f385857cfbf2befcd9fea45e4eac","observation_id":"1e2a60dd-c23d-4c1e-a37e-54b30ea386c4","resolution":{"observed_at":"2026-08-11T16:35:17.329129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.936771Z","title":"Carla: An open urban driving simulator","venue":null,"work_id":"50487871-aedf-43db-981a-ec18ad51c9f8","year":2017},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.331471Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:a6d5b5b6abe3cd4237c51fa2c79e63baa0d948dcbfaad210e7f3ec924276359c","observation_id":"682cf184-36af-4604-9c6a-7715f8c19e1d","resolution":{"observed_at":"2026-08-11T16:35:17.939533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.333563Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.333563Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:e4bbbb8f179dce68b85218308e9a7f511f5ebdca42b10cecb026177a7d8adbee","observation_id":"8e4f7473-bce7-4995-9b69-b98970c2e7e1","resolution":{"observed_at":"2026-08-11T16:35:17.333563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.925568Z","title":"St-p3: End-to-end vision-based au- tonomous driving via spatial-temporal feature learning","venue":null,"work_id":"a62c87e9-a60a-4fe5-98ec-85a89923c2c0","year":2022},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.335532Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:78ab888fa8b946b4d469b141607a457ecc9142492fc7be34b60ccb7a583aa813","observation_id":"3301d1a6-b25e-4c8c-b185-803502d84597","resolution":{"observed_at":"2026-08-11T16:35:17.928410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.918745Z","title":"Planning-oriented autonomous driv- ing","venue":null,"work_id":"1fbf48b1-c8f7-459d-a73f-49493c1deb4c","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.337838Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:0a044d125c4b2f9af0b5e2dac16ce28d1c0d68002a8f2c77a0c519da026495b3","observation_id":"c578c841-b2db-4adc-bad4-6706a7895b37","resolution":{"observed_at":"2026-08-11T16:35:17.921246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.911301Z","title":"Vad: Vectorized scene representation for efficient autonomous driving","venue":null,"work_id":"1c84ea71-eba9-46c9-8fa3-17785a3b87d9","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.339932Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:b40bb3208cd66763a755ee4d306eab3a74af3fb96d09a7c9d3069d8263832ddb","observation_id":"c0cc2082-80f3-4449-9f35-5eff095b33d9","resolution":{"observed_at":"2026-08-11T16:35:17.914080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.904127Z","title":"Adapt: Action-aware driving caption transformer","venue":null,"work_id":"06801a61-f5a6-42c0-ab92-95f8206b5452","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.342033Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:48c46c4f58b461afc1aa3867721a301fe8fb6ab368eca8d96ac94a74fbf86f3e","observation_id":"ebc3f10e-1f2c-4ae8-a486-c8931206f787","resolution":{"observed_at":"2026-08-11T16:35:17.906775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.896970Z","title":"Textual explanations for self-driving vehicles","venue":null,"work_id":"f3a8fb6d-a4ad-4b35-ba88-e38f88f9c04c","year":2018},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.343961Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:1e3156ad8b12169ba9d49273cf158e6e280395e37e56ae50bee85c0ecca6db5c","observation_id":"6f1212eb-411c-4f82-90d3-72b1c328e6c8","resolution":{"observed_at":"2026-08-11T16:35:17.899543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.889827Z","title":"Grounding human-to-vehicle advice for self- driving vehicles","venue":null,"work_id":"f07c3efd-abe0-43a2-8ce8-f0d12651891e","year":2019},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.346081Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:37a7f993fcedc31fffdc580494f7bb6d2a82b109ad293f8c8cab696b16d46397","observation_id":"a4eeab96-57ef-4e2a-a61c-e3c1ab78ad37","resolution":{"observed_at":"2026-08-11T16:35:17.892485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.882720Z","title":"Knowledge representation and reasoning","venue":null,"work_id":"17bb5e39-c652-4ed1-89a0-ec6d2ffafd24","year":1986},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.349194Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:619a88c3370f8f6b3d91e2e8164f49bf5a419dca714dd42f34be53fe57735488","observation_id":"19023ce4-a147-41d3-8dbd-36677f08a837","resolution":{"observed_at":"2026-08-11T16:35:17.885258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04316","last_updated":"2023-12-27T05:37:25Z","snapshot_observed_at":"2026-08-13T05:07:57.146204Z","submitted_at":"2023-12-07T14:17:17Z","title":"Towards Knowledge-driven Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04316","snapshot_observed_at":"2026-08-11T16:35:17.351260Z","title":"Towards knowledge-driven autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.351260Z"},"links":{"cited_paper":"/paper/2312.04316","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:b3f67b625102bb784958a2323be50f56bd8f8648cb2ccfe9a6585c4da0635d99","observation_id":"4ddba1f5-f351-4868-bdb8-d6cf228287ce","resolution":{"observed_at":"2026-08-11T16:35:17.351260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10595","last_updated":"2024-12-06T01:54:59Z","snapshot_observed_at":"2026-08-14T17:42:28.545988Z","submitted_at":"2024-04-16T14:20:55Z","title":"Automated Evaluation of Large Vision-Language Models on Self-driving Corner Cases","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10595","snapshot_observed_at":"2026-08-11T16:35:17.356576Z","title":"Automated evaluation of large vision- language models on self-driving corner cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.356576Z"},"links":{"cited_paper":"/paper/2404.10595","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:cb4fa78dd413dc2986b59b2e9c88c922180ab974b8376fcbe584dd77b79f862f","observation_id":"1c958d98-78d3-44a9-96d2-4462074a7ef2","resolution":{"observed_at":"2026-08-11T16:35:17.356576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.876412Z","title":"Visual instruction tuning","venue":null,"work_id":"582fadfc-549e-4abf-8155-468a990351d2","year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.359217Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:d131d8869febad95968413937670486bb58de8355eb480870aa150ad99b46117","observation_id":"48cf9d2c-4176-4955-b600-f7948d885e7b","resolution":{"observed_at":"2026-08-11T16:35:17.878682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.361897Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.361897Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:4fed8a2d469d79ca68a1bf72bfa3192030e4858ae087f94477a0fbf5ec03eb6f","observation_id":"9878622d-d1ae-4b80-aeed-a592d766066b","resolution":{"observed_at":"2026-08-11T16:35:17.361897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T16:35:17.364737Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.364737Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:6ae9fb82e2621e50722a63d42062e709620e7fdfaeb8f42918028572876a5a93","observation_id":"dad24fca-80b4-48a4-9967-3190f0f76469","resolution":{"observed_at":"2026-08-11T16:35:17.364737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T16:35:17.367328Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.367328Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:566aede47071842402bab9f8a1621630d423b2c549f72e62f805b320391c8f1a","observation_id":"97edd19a-0225-4144-b8be-64f6aa9998fc","resolution":{"observed_at":"2026-08-11T16:35:17.367328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.866587Z","title":"Drama: Joint risk localization and captioning in driving","venue":null,"work_id":"300ef9f6-1989-421f-abd3-33c570ba8ea6","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.370078Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:783635bc254fef99b61904b618b8d417ca7e383960dc4903ac2ec0b804b95a13","observation_id":"d30b1989-2616-4541-87b4-e9bb8ec5e882","resolution":{"observed_at":"2026-08-11T16:35:17.868792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14115","last_updated":"2024-09-26T15:30:00Z","snapshot_observed_at":"2026-08-13T04:55:52.245365Z","submitted_at":"2023-12-21T18:40:34Z","title":"LingoQA: Visual Question Answering for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14115","snapshot_observed_at":"2026-08-11T16:35:17.372660Z","title":"Lingoqa: Video question answering for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.372660Z"},"links":{"cited_paper":"/paper/2312.14115","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:ee95f2918bfc2a1c4606ac63f6c67ab6d5b9234f47b4942421d80dc4c34d8021","observation_id":"c0e05998-dc84-4fe9-ac0b-44c3f0979833","resolution":{"observed_at":"2026-08-11T16:35:17.372660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.375387Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.375387Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:647c4a163ce4eaeca80f57d73291aaede35d651d27e8b251d37e3395f159e113","observation_id":"410d1120-7585-4125-b222-e01e03ec20b1","resolution":{"observed_at":"2026-08-11T16:35:17.375387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.856821Z","title":"Multi- modal fusion transformer for end-to-end autonomous driving","venue":null,"work_id":"1a29960d-e047-45b4-8de6-4a427becf51d","year":2021},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.377992Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:3ec1b794ddce49f74857e0924db8a26cbc6be9a93c5c2c3236775a2753d0e7ef","observation_id":"2fe4b077-1607-4556-bd86-6d15329f0360","resolution":{"observed_at":"2026-08-11T16:35:17.859030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.850818Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"6219b462-ecc1-4104-bb63-a7db4044a42a","year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.380478Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:fb4b2fe1deae2dd6cf9b261f8d3d7a675ce080f6c15f1c0c728fff8fc81ee76a","observation_id":"d5caaf17-ff3b-4c2a-a8d1-6b34d3194ad5","resolution":{"observed_at":"2026-08-11T16:35:17.853042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.844634Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"545255ae-7369-404b-9d84-5cd164f947c2","year":2021},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.383143Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:d7634b71f81d032f333523f41be61bbbc84a4c0fce257459d0ad196beda1673c","observation_id":"411fabf2-b312-41ff-a21d-218551321fca","resolution":{"observed_at":"2026-08-11T16:35:17.846819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.838343Z","title":"Toward driving scene understanding: A dataset for learning driver behavior and causal reasoning","venue":null,"work_id":"f6952c2f-eef8-4f33-b773-dcaddfd9fdb1","year":2018},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.385727Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:8744e4f95b4ff17505cecba6ead16a51a4f8d4e08f31b41e7fcff34fb9d678a7","observation_id":"1ef144fc-ab28-4bd3-9ba5-6e6d4c461b76","resolution":{"observed_at":"2026-08-11T16:35:17.840567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.830944Z","title":"Safety-enhanced autonomous driving using inter- pretable sensor fusion transformer","venue":null,"work_id":"09842b69-a483-4e01-bc39-4441b74298dc","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.388233Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:1e333cda606dcef22e54edf3853a7b37bf4c98bfcee2436989fca2e68eb361ff","observation_id":"924f91fb-7e58-4504-8af0-8d21f30181a2","resolution":{"observed_at":"2026-08-11T16:35:17.834026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.823682Z","title":"Reasonnet: End-to-end driv- ing with temporal and global reasoning","venue":null,"work_id":"1a33d5cc-2eb5-4118-a9b9-3f2e3949dbd6","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.390816Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:a3cb303d588d405a1dde13475f0ff6b4e4797b84156c4f85451c79692884f443","observation_id":"1654e167-bfe9-473a-accb-303b88908a5e","resolution":{"observed_at":"2026-08-11T16:35:17.826577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.816149Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models","venue":null,"work_id":"48dd6a36-ed4a-4cc5-bbe3-6c2baa46df0f","year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.456133Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:d7d8c6fc63be56a6278fde1ebb34336229184cf207b23417e47f603bcfca6420","observation_id":"25cce3c1-47ff-40e9-9406-661a45aa435c","resolution":{"observed_at":"2026-08-11T16:35:17.818905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-13T04:55:49.773157Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-11T16:35:17.458991Z","title":"Drivelm: Driving with graph visual ques- tion answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.458991Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:8d932226c104aa7221084077ad3566368b69562b2301871bfd81404c0118c052","observation_id":"ca4a2359-d481-466f-a887-409df766c2a0","resolution":{"observed_at":"2026-08-11T16:35:17.458991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.807982Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"7119db72-25b5-46a1-a6bf-518b9031fa32","year":2020},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.461725Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:f8fe7ad3b19d5f60b504ba886a4f1fa72d2f04ee77f52b3aae2640a2fb3b3296","observation_id":"f3846abe-56ed-47db-9b7c-0c5a91bc6a02","resolution":{"observed_at":"2026-08-11T16:35:17.811052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-11T16:35:17.464331Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.464331Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:3916f516355e3b79a136bae1345adb07ff4a5adf3cd28c4d3df4d0a652b85bc4","observation_id":"263d49a2-2de9-4a9f-a153-fb4471654e88","resolution":{"observed_at":"2026-08-11T16:35:17.464331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.799175Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":"8f39cd65-cda8-44d7-813b-50aa79e38da1","year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.467073Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:0df623005c1587d4dd58f814618ae6488799ece58654d29c591c8059b63227a1","observation_id":"8d3ff5ea-8413-49a9-9358-a88a34a9c8a0","resolution":{"observed_at":"2026-08-11T16:35:17.802362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.791388Z","title":"Cider: Consensus-based image description evalu- ation","venue":null,"work_id":"4ad961cb-0425-421f-8ba2-8725090b5eb8","year":2015},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.469206Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:ec3befeb849a081fda10f9ab195ce6754b3c5501398564530d3203e7f2e97209","observation_id":"de9efed9-54b6-4f24-ba66-716930cec493","resolution":{"observed_at":"2026-08-11T16:35:17.793871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.471390Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.471390Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:c3e33128ba11e39c8b7fe27c7ba2332603e3344f2fba1ab632df2ea8f6a8aa43","observation_id":"7b44f744-6236-46e4-a677-9ec13d34fa39","resolution":{"observed_at":"2026-08-11T16:35:17.471390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.783791Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model","venue":null,"work_id":"726a88c4-35b3-48ed-be94-72de51c329ca","year":null},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.473637Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:a7b2e3339aeaa8cd982c15260b23b06fcaf2c8dc90ba0f875f3d8a82cfde2cdb","observation_id":"aec87cd5-522e-4aa9-b222-b557e5dfb834","resolution":{"observed_at":"2026-08-11T16:35:17.786459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.476047Z","title":"Rag-driver: Gen- eralisable driving explanations with retrieval-augmented in- context learning in multi-modal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.476047Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:5cb79c8feca308b5e23ea0ca35e7799390e308a78ef21dfe73a870351d0d42d2","observation_id":"4de2d74b-e40c-4096-8cd4-d42eef7e8b65","resolution":{"observed_at":"2026-08-11T16:35:17.476047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:35:17.774542Z","title":"End-to-end urban driving by imitating a re- inforcement learning coach","venue":null,"work_id":"abb45fd1-19da-460b-beb6-86e15d8e5f6c","year":2021},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.477994Z"},"links":{"citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:407d109bfe7ce08ddbc331719406abf3af92b0736e9e1b5aa7dbb8ad8ea68a00","observation_id":"04433515-9eb9-498a-a7b5-6ab8884ea5c5","resolution":{"observed_at":"2026-08-11T16:35:17.778873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04593","last_updated":"2024-03-07T15:39:18Z","snapshot_observed_at":"2026-08-13T06:56:04.324659Z","submitted_at":"2024-03-07T15:39:18Z","title":"Embodied Understanding of Driving Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04593","snapshot_observed_at":"2026-08-11T16:35:17.480171Z","title":"Embodied understanding of driving scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:35:17.480171Z"},"links":{"cited_paper":"/paper/2403.04593","citing_paper":"/paper/2412.09951"},"observation_digest":"sha256:134c49d76ac8623c7c037a886851e86a1f79837e425bd4824fc07749aec8cff6","observation_id":"a43f6623-837b-4426-bd67-702236fdcbc4","resolution":{"observed_at":"2026-08-11T16:35:17.480171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09951","last_updated":"2024-12-17T09:27:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T16:37:10.024007Z","submitted_at":"2024-12-13T08:14:24Z","title":"WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 11 inbound Pith citation observations for arXiv:2412.09951."}