{"as_of":"2026-08-18T10:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1e693aa361212bb465f2d09c3eef447171ac602e5c6d3ffbbc420c4e0fa4704","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:25:15.023517Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:40:53.581229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:29:38.015297Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2508.12603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12603","snapshot_observed_at":"2026-07-04T06:29:38.015297Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving,","venue":null,"work_id":"518e64ec-b7a9-4e07-9aec-dc4b022f24b5","year":2025},"citing_paper":{"arxiv_id":"2606.21165","last_updated":"2026-08-07T21:15:02Z","snapshot_observed_at":"2026-08-16T02:13:16.810833Z","submitted_at":"2026-06-19T07:00:14Z","title":"OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:24:07.496389Z"},"links":{"cited_paper":"/paper/2508.12603","citing_paper":"/paper/2606.21165"},"observation_digest":"sha256:837f8696c84cabc5049c3fc98d76cd7588ae203e187f85067f3382e0bee05a6a","observation_id":"21b30d6e-e7a1-4faa-946f-b180a8dd5508","resolution":{"observed_at":"2026-07-04T06:29:38.017036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12603","snapshot_observed_at":"2026-08-02T05:17:28.595180Z","title":"Vilad: A large vision language diffusion framework for end-to-end autonomous driving.ArXiv preprint, abs/2508.12603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13431","last_updated":"2026-07-15T04:23:22Z","snapshot_observed_at":"2026-08-07T01:50:04.940823Z","submitted_at":"2026-07-15T04:23:22Z","title":"Discrete Diffusion Models: A Unified Framework from Tokenization to Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:28.595180Z"},"links":{"cited_paper":"/paper/2508.12603","citing_paper":"/paper/2607.13431"},"observation_digest":"sha256:4896425b196daffee2bbea2c0c3229c04afe61226f9dce78e6308b68199271b3","observation_id":"c0c61636-e4ab-4a06-808e-921822e59ef5","resolution":{"observed_at":"2026-08-02T05:17:28.595180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12603","snapshot_observed_at":"2026-08-06T00:40:53.581229Z","title":"arXiv preprint arXiv:2508.12603 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01035","last_updated":"2026-08-14T02:52:11Z","snapshot_observed_at":"2026-08-18T09:09:45.537148Z","submitted_at":"2026-08-02T06:45:16Z","title":"WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T00:40:53.581229Z"},"links":{"cited_paper":"/paper/2508.12603","citing_paper":"/paper/2608.01035"},"observation_digest":"sha256:550d92b5f00b44a6eee2abd31ecc0591b935561754823a44561f51e8eee2ce3d","observation_id":"4bd99c2f-8510-436b-84a9-38936027b707","resolution":{"observed_at":"2026-08-06T00:40:53.581229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12603/citation-record","integrity":"/paper/2508.12603/integrity","json":"/paper/2508.12603/citation-record.json","paper":"/paper/2508.12603"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.808764Z","title":"4\" FUNCTION default.is.dash.repeated.names #1 FUNCTION default.name.format.string","venue":null,"work_id":"cbe352ea-8e1d-4e61-ad65-ad18e4f74eb5","year":2003},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.849051Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:a6178e5c0491978cd6ec338fb4df46f67e1da3b9ebe382a0fbbb9b06da2df637","observation_id":"edb5b6ac-4e90-4cd9-b9a1-093d7367b839","resolution":{"observed_at":"2026-08-15T17:25:15.815014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:14.854891Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.854891Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:99d40c2e16c53c4908dece1d0562fd9a1be357c78d4a67355e5536e32c0629dd","observation_id":"6cf8f7e5-1640-4567-8129-72be0c90c85b","resolution":{"observed_at":"2026-08-15T17:25:14.854891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12320","last_updated":"2023-11-21T03:32:01Z","snapshot_observed_at":"2026-08-16T14:41:38.626307Z","submitted_at":"2023-11-21T03:32:01Z","title":"A Survey on Multimodal Large Language Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12320","snapshot_observed_at":"2026-08-15T17:25:14.859646Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.859646Z"},"links":{"cited_paper":"/paper/2311.12320","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:1f973ac0c0aa722df2faf97bfb4a5d7e6986b30724d4c2608395c137967b0f92","observation_id":"1ce5662c-b6f7-4aea-b749-dbbb3b648906","resolution":{"observed_at":"2026-08-15T17:25:14.859646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.780347Z","title":null,"venue":null,"work_id":"53527b11-6b9e-4da7-aa39-d519bb952991","year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.865273Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:33d47443604c38cb5d183671dbdc5a5b68c7ce4bbacd1b862986f791318e8600","observation_id":"a172a0f8-e6d3-4e55-be87-27e4fa23e01b","resolution":{"observed_at":"2026-08-15T17:25:15.785501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-08-16T14:55:46.020378Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-15T17:25:14.869948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.869948Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:1f06c3395455699936d3452adc06cd0ca055545ddb3c430b980d42b35d67a5f9","observation_id":"070e87f5-0122-46b2-822c-48dbc553f2b4","resolution":{"observed_at":"2026-08-15T17:25:14.869948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1049565","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.633372Z","title":null,"venue":null,"work_id":"0fee61ea-2116-4fa9-a61e-4670bc20fbed","year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.874882Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:031680194fae5d6579e57e25d550020df0f283ca3f99c4d748bcb24c9db406ab","observation_id":"c62a4c4b-40ec-4fc5-8dda-8ba953c1cd86","resolution":{"observed_at":"2026-08-15T17:25:15.642600Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12288","last_updated":"2024-05-26T17:45:21Z","snapshot_observed_at":"2026-08-17T20:26:12.888582Z","submitted_at":"2023-09-21T17:52:19Z","title":"The Reversal Curse: LLMs trained on \"A is B\" fail to learn \"B is A\"","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12288","snapshot_observed_at":"2026-08-15T17:25:14.879443Z","title":"a is b\" fail to learn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.879443Z"},"links":{"cited_paper":"/paper/2309.12288","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:7e8803a25a10e48f1f57fc945106e74653553173ed7ed1320e7c0d864569a06b","observation_id":"4c7a3a3a-4d1d-484a-a985-b2cf339231e5","resolution":{"observed_at":"2026-08-15T17:25:14.879443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-15T17:25:14.884679Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.884679Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:22a8113fdbe61ac45597c9187264f5657649ca49fdfed21e7cc9bf0c55991833","observation_id":"14c41f62-c223-45d7-ab8c-45a5256bd57b","resolution":{"observed_at":"2026-08-15T17:25:14.884679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14415","last_updated":"2025-05-02T01:02:47Z","snapshot_observed_at":"2026-08-17T23:13:01.009850Z","submitted_at":"2024-12-19T00:06:09Z","title":"DriveGPT: Scaling Autoregressive Behavior Models for Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14415","snapshot_observed_at":"2026-08-15T17:25:14.889326Z","title":"Huang, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.889326Z"},"links":{"cited_paper":"/paper/2412.14415","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:d8794125e68836896faf03463b00dee11a3aa8196601455f0ac938cbf23cf0cb","observation_id":"5950d4bd-3052-484e-aa3c-fb32e645840d","resolution":{"observed_at":"2026-08-15T17:25:14.889326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.764357Z","title":null,"venue":null,"work_id":"29bb1904-db42-4544-86fa-9866c8a0e82a","year":2022},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.894087Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:cb52df79cf4b9082ed20eefe355142170ba65f383d5f3e16d506db11dd7e0663","observation_id":"5ca50948-78f0-49f6-ad20-0aa98cdaeb49","resolution":{"observed_at":"2026-08-15T17:25:15.769315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:14.898535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.898535Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:654859d94904a245f1b7bdb990ac72e4b4835deee969f4b9cead98775f652c5d","observation_id":"7ae2e67f-303f-4c45-812e-e9f7ae9ed0ba","resolution":{"observed_at":"2026-08-15T17:25:14.898535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16996","last_updated":"2024-03-25T17:59:01Z","snapshot_observed_at":"2026-08-16T14:06:34.394777Z","submitted_at":"2024-03-25T17:59:01Z","title":"DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16996","snapshot_observed_at":"2026-08-15T17:25:14.903303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.903303Z"},"links":{"cited_paper":"/paper/2403.16996","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:c4cb3b51cc78698160c2be5bb74a2a606d6b860b053866cefe1c774a87faa204","observation_id":"a7e28159-6215-4e3e-8d7a-9da8172801e5","resolution":{"observed_at":"2026-08-15T17:25:14.903303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-16T10:28:44.439043Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-15T17:25:14.907908Z","title":"Hwang, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.907908Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:cdf064c6cf06cfcaaaf4a672531f22a358afb1386fd39986d6217da111500f51","observation_id":"0988a1b5-94dd-4335-88b3-4ee97704786e","resolution":{"observed_at":"2026-08-15T17:25:14.907908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.748129Z","title":null,"venue":null,"work_id":"6da98a63-c1cd-425f-bece-7a49c0584fb0","year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.912630Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:38973821984ca6567e13b7d04a5e149c686aed7f57c4ae16efb24d988d1b6049","observation_id":"a85f98ac-2f67-4feb-be41-89234914192c","resolution":{"observed_at":"2026-08-15T17:25:15.753288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15324","last_updated":"2024-10-25T16:00:54Z","snapshot_observed_at":"2026-08-16T21:50:31.745386Z","submitted_at":"2024-05-24T08:07:28Z","title":"Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15324","snapshot_observed_at":"2026-08-15T17:25:14.917027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.917027Z"},"links":{"cited_paper":"/paper/2405.15324","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:085a957f3cbe2c3887b4ff2997f79b012d67b34612786f5f2e4d6fb9d7157be6","observation_id":"3ed956ca-8230-4dcf-8c6b-2c156ae2dba1","resolution":{"observed_at":"2026-08-15T17:25:14.917027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-15T17:25:14.921543Z","title":"Jiang, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.921543Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:a6649aec612daa4a341709ec1afb370b49875add2b8e1ba6f11ec6502db21bdf","observation_id":"a0deb9c3-430d-40b6-af0a-8bed90c44161","resolution":{"observed_at":"2026-08-15T17:25:14.921543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20108","last_updated":"2025-03-01T23:17:26Z","snapshot_observed_at":"2026-08-17T21:07:51.257470Z","submitted_at":"2025-02-27T14:02:14Z","title":"VDT-Auto: End-to-end Autonomous Driving with VLM-Guided Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20108","snapshot_observed_at":"2026-08-15T17:25:14.926265Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.926265Z"},"links":{"cited_paper":"/paper/2502.20108","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:a1bbc70ddabbe0391385fcce5e65e514f124352e4c41eea8a7d26606f3ed7bed","observation_id":"c1fae45a-ce62-424f-98e6-53329e7ea804","resolution":{"observed_at":"2026-08-15T17:25:14.926265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-15T20:54:24.552667Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19755","snapshot_observed_at":"2026-08-15T17:25:14.930877Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.930877Z"},"links":{"cited_paper":"/paper/2503.19755","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:3d7003c98f98ac720e0926ef7e94785a2505a4146a74212112020d3bc45196c0","observation_id":"6135445c-b0c4-4944-8518-97b151d6176e","resolution":{"observed_at":"2026-08-15T17:25:14.930877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-17T08:41:51.069276Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-15T17:25:14.935617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.935617Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:5a7bc4574480f88a910feb30d5b7248e48cdb62ca3735c952e303606a56db118","observation_id":"be4665de-631c-4724-af0e-127ef806586b","resolution":{"observed_at":"2026-08-15T17:25:14.935617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.731008Z","title":"Sohl-Dickstein, E","venue":null,"work_id":"1c58cb13-060e-41b8-b754-25510ef187ab","year":2015},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.940559Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:551efb7eb2e1567ef094beda3b87a88e8379cff523124522f8edbe92fa819222","observation_id":"20996183-76b3-4cae-963b-667ef82e9cb0","resolution":{"observed_at":"2026-08-15T17:25:15.736691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:14.944929Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.944929Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:df4cced8207566ec1fd9c1c93462d2c541e58270e6ce8c458bf8aadc71631fcd","observation_id":"2622ac05-761d-4208-b187-f9261418cd7b","resolution":{"observed_at":"2026-08-15T17:25:14.944929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-15T17:25:14.949427Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.949427Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:d7424e6b650d8fdbff4a86c406f73f3d36e72bd7a39f6cc5b1f6a78f9999e643","observation_id":"db56dc24-9beb-4f3e-8fe7-12861a24e098","resolution":{"observed_at":"2026-08-15T17:25:14.949427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-15T17:25:14.953864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.953864Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:b167fcf49155fd465a9d61c487a3fc78639639b6e7e9a507d4ed297d3ccc81f5","observation_id":"fd6a6fcc-515d-4094-ad35-f8cc59fa2967","resolution":{"observed_at":"2026-08-15T17:25:14.953864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.703728Z","title":"Austin, D","venue":null,"work_id":"3d4ac95b-6623-4fce-bf51-cfe260805d96","year":2021},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.958468Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:e6a17360555cdd9fd895b25ac144870200ae701ea32d58f477a6c6d1488a88ad","observation_id":"481c74a2-3e3f-4758-8fa1-a0f83f09630f","resolution":{"observed_at":"2026-08-15T17:25:15.708776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-08-14T20:57:18.809821Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-15T17:25:14.962924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.962924Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:6309729cab9c3db6200d96a191b23b3d9e8601ef71cc9db9ddf3665660836cdd","observation_id":"01a247c3-4c09-4a01-9db2-45e6febd95ee","resolution":{"observed_at":"2026-08-15T17:25:14.962924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-17T08:48:28.586317Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-15T17:25:14.967767Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.967767Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:b60e7235e68eb4f05e0167d240515860c45cd8f9607af1ad864e1354823ad2d3","observation_id":"a578e6ae-d826-4f4b-9f70-c28694dd7da9","resolution":{"observed_at":"2026-08-15T17:25:14.967767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-08-15T09:00:05.244407Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-15T17:25:14.972325Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.972325Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:a5a77e9fb35de18d18d1f566ba43901ad0748cc14c3eb1ef9f03bac4c3c6a50e","observation_id":"4a2132a4-071c-4a55-bb50-ab758f0796f7","resolution":{"observed_at":"2026-08-15T17:25:14.972325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11913","last_updated":"2024-11-17T23:20:37Z","snapshot_observed_at":"2026-08-14T23:38:29.330365Z","submitted_at":"2024-11-17T23:20:37Z","title":"On-Board Vision-Language Models for Personalized Autonomous Vehicle Motion Control: System Design and Real-World Validation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11913","snapshot_observed_at":"2026-08-15T17:25:14.977204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.977204Z"},"links":{"cited_paper":"/paper/2411.11913","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:a3ad398cf08a29ad6cf494c24d138eb80ca2d88fca903395af80b5ca3537216a","observation_id":"14f56680-3ca2-492c-b40b-a6e36f27482e","resolution":{"observed_at":"2026-08-15T17:25:14.977204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-15T17:25:14.981768Z","title":"Tschannen, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.981768Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:bbe2c9ac9afc5d15d5207a2017817d4abe58c653f0a365bedb827e2345a48f15","observation_id":"d975345e-3c88-4a71-8d50-2035972636ff","resolution":{"observed_at":"2026-08-15T17:25:14.981768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-15T17:25:14.986125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.986125Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:6daa651abab6cc45724992e78f2a3487f75e1b26fad76332e41d30affd88e132","observation_id":"eb204c35-728d-494d-968b-3cd52d07d108","resolution":{"observed_at":"2026-08-15T17:25:14.986125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:25:15.687358Z","title":"Caesar, V","venue":null,"work_id":"83b063d5-d358-4630-82d6-d1b3b29da399","year":2020},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.990875Z"},"links":{"citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:dfdaee249cc46876812b372daa15a18f6260281ba90301a387d50ebdf57d3061","observation_id":"d4cc1fb2-6a36-4525-a826-bea642becbdc","resolution":{"observed_at":"2026-08-15T17:25:15.692781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-15T17:25:14.995230Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:14.995230Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:eab22d7928d4c338393f1237652e1f7ef7c9a4b9923c656ad915f3b590d81f24","observation_id":"fe38b8b8-4940-4816-b660-99bf82b67ee6","resolution":{"observed_at":"2026-08-15T17:25:14.995230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T17:25:15.004897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:15.004897Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:762529ea6d3b5a308215cfdc68b6ba176d0fc60a535914f3c10b074ae41e1554","observation_id":"33399631-4d76-41e3-a37c-d413ec697a3c","resolution":{"observed_at":"2026-08-15T17:25:15.004897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06295","last_updated":"2026-06-06T06:01:00Z","snapshot_observed_at":"2026-08-18T01:58:21.472807Z","submitted_at":"2025-05-17T15:50:46Z","title":"dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06295","snapshot_observed_at":"2026-08-15T17:25:15.009446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:15.009446Z"},"links":{"cited_paper":"/paper/2506.06295","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:b34bd955f9101a4fb1212195b46586c869998e0a6d0240bf1a414e233934ca26","observation_id":"f68ea2e7-3502-47f2-a83b-a8fd80be93bf","resolution":{"observed_at":"2026-08-15T17:25:15.009446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T17:25:15.014532Z","title":"Zhang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:15.014532Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:d8132a7922c63848f9cce78d558e33af6412176de8604108109a03f65306a511","observation_id":"3535b9a6-f48e-47db-b830-6a25ab853418","resolution":{"observed_at":"2026-08-15T17:25:15.014532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:25:15.019067Z","title":"2023, arXiv:2303.08774 [cs.CL]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:15.019067Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:de247115c38e6cf942715728f411b694477eca532a512baa5405f03da42d35f0","observation_id":"1acfb941-ee84-4fba-8875-8de455978eb5","resolution":{"observed_at":"2026-08-15T17:25:15.019067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T17:25:15.023517Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:25:15.023517Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.12603"},"observation_digest":"sha256:36dd13170bb3585d5c54e03d9da4d306acf8d6ca6406520528d68297b853f7be","observation_id":"d2c02d31-849a-4dde-922d-ba786a720962","resolution":{"observed_at":"2026-08-15T17:25:15.023517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12603","last_updated":"2025-08-18T04:01:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:55:12.751827Z","submitted_at":"2025-08-18T04:01:56Z","title":"ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 3 inbound Pith citation observations for arXiv:2508.12603."}