{"as_of":"2026-08-09T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e69ab891939f3b57fb36d794225691e2e66f46c4d5244ea992dfdf2fcc29e25e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:24:07.325451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.563623Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-05T21:57:39.132989Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T08:10:39.240168Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2503.19755"},"observation_digest":"sha256:8772e19a811c224a1a54ed240cda4fcee366ad6ee86190530c8d1364f0b46c1d","observation_id":"6756f4cd-a63c-44c5-91cd-c115d8e8f6f7","resolution":{"observed_at":"2026-05-17T08:10:39.392246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-07T15:24:07.325451Z","title":"CarLLaV A: Vision language models for camera-only closed-loop driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15863","last_updated":"2025-05-21T07:59:18Z","snapshot_observed_at":"2026-08-07T23:22:27.322342Z","submitted_at":"2025-05-21T07:59:18Z","title":"Generative AI for Autonomous Driving: A Review","version":1},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:07.325451Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2505.15863"},"observation_digest":"sha256:00a751ab3f794541566e036a2bab23899d974c29992ed87e26c5cdf45485ea8b","observation_id":"3b29bd27-3d8c-4f05-8e06-16e447ee5871","resolution":{"observed_at":"2026-08-07T15:24:07.325451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-07T05:59:18.570814Z","title":"Carllava: Vision language mod- els for camera-only closed-loop driving.arXiv preprint arXiv:2406.10165, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06664","last_updated":"2025-06-07T05:06:05Z","snapshot_observed_at":"2026-08-09T02:59:06.476082Z","submitted_at":"2025-06-07T05:06:05Z","title":"Generalized Trajectory Scoring for End-to-end Multimodal Planning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:18.570814Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2506.06664"},"observation_digest":"sha256:fbc49317879f40586fdb80dfed2ee73ce5f87de5c457803ccdff3f59beb277c3","observation_id":"72e4307d-33d0-4567-ae10-668bb23074c8","resolution":{"observed_at":"2026-08-07T05:59:18.570814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-07T05:32:32.675801Z","title":"CarLLaV A: Vi- sion language models for camera-only closed-loop driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07725","last_updated":"2025-06-09T13:11:02Z","snapshot_observed_at":"2026-08-07T09:58:59.730637Z","submitted_at":"2025-06-09T13:11:02Z","title":"ETA: Efficiency through Thinking Ahead, A Dual Approach to Self-Driving with Large Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:32:32.675801Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2506.07725"},"observation_digest":"sha256:41a4ee1dc784c5575029ac72ce045c865a87d9c6309bdc096d268bb98b232a07","observation_id":"db19ec5a-0383-4d55-927e-91ddafaea5de","resolution":{"observed_at":"2026-08-07T05:32:32.675801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T21:46:43.955825Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2506.13757"},"observation_digest":"sha256:b517bf9a5495536a49e488ff9e00e74ec1850662eeefa420daf575c8df70fcef","observation_id":"dfcea971-7b05-491e-ad11-895c84303b51","resolution":{"observed_at":"2026-05-14T21:46:44.177559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-06T16:40:04.319609Z","title":"Carllava: Vision language models for camera-only closed-loop driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12911","last_updated":"2025-08-20T06:32:37Z","snapshot_observed_at":"2026-08-07T05:29:00.542532Z","submitted_at":"2025-07-17T08:58:24Z","title":"LaViPlan : Language-Guided Visual Path Planning with RLVR","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:04.319609Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2507.12911"},"observation_digest":"sha256:478792658ecf95d9bb4a8f2a1d226bfca52a5ec28bb35cafaf6a8e9d04859ef2","observation_id":"10e4463e-a45e-4816-8eb5-f213050b1545","resolution":{"observed_at":"2026-08-06T16:40:04.319609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-05T13:58:10.219174Z","title":"CarLLaV A: Vi- sion language models for camera-only closed-loop driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21824","last_updated":"2025-08-29T17:59:53Z","snapshot_observed_at":"2026-08-05T13:58:03.024516Z","submitted_at":"2025-08-29T17:59:53Z","title":"DriveQA: Passing the Driving Knowledge Test","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T13:58:10.219174Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2508.21824"},"observation_digest":"sha256:2b7dc3e6abb2dc14104f51fff038905cb19bcc2fff9f8234d947efd974409b3a","observation_id":"9ec1907e-0dfe-4b4b-88c5-64f011d8ef7b","resolution":{"observed_at":"2026-08-05T13:58:10.219174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2509.00789","last_updated":"2026-04-19T12:44:09Z","snapshot_observed_at":"2026-08-07T16:49:08.273704Z","submitted_at":"2025-08-31T10:34:44Z","title":"CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T20:10:43.416488Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2509.00789"},"observation_digest":"sha256:7d2dbe0171fd9f2a853335533d25266f6ff237c719f8607682d5e9a1655670c9","observation_id":"5152c52a-e923-4061-bc27-7bf10ca16f53","resolution":{"observed_at":"2026-05-18T20:11:50.808741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2510.12796","last_updated":"2025-12-18T07:25:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-14T17:59:47Z","title":"DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T06:48:00.943591Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2510.12796"},"observation_digest":"sha256:08d8ef568e1f5d3d1d80723b7e7ca8f120babaab1e646a17b6395dde39b28851","observation_id":"390ac7d7-d185-435a-bca2-de21f12fd849","resolution":{"observed_at":"2026-05-17T06:48:01.087290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-03T16:52:55.423521Z","title":"arXiv preprint arXiv:2406.10165","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-03T16:52:46.785804Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:55.423521Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:71f0a4310d7a819dd19de856534a3821f0920f7db6789106eab33d155bc52888","observation_id":"37984482-9bc7-4476-898c-5b83ac98484d","resolution":{"observed_at":"2026-08-03T16:52:55.423521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2601.01762","last_updated":"2026-06-16T06:55:19Z","snapshot_observed_at":"2026-08-07T10:50:29.315801Z","submitted_at":"2026-01-05T03:41:20Z","title":"AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T18:39:49.416119Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2601.01762"},"observation_digest":"sha256:4b3db6ba3658b71d686ae8964229ed646031ef2b79e702079ce798bd97f9bfa3","observation_id":"dbbaca0c-d952-4cf0-9b47-521a441d1a54","resolution":{"observed_at":"2026-05-16T18:41:11.162098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-03T12:48:35.811131Z","title":"Carllava: Vision language models for camera- only closed-loop driving.arXiv preprint arXiv:2406.10165,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.01762","last_updated":"2026-06-16T06:55:19Z","snapshot_observed_at":"2026-08-07T10:50:29.315801Z","submitted_at":"2026-01-05T03:41:20Z","title":"AlignDrive: Aligned Lateral-Longitudinal Planning for End-to-End Autonomous Driving","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:48:35.811131Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2601.01762"},"observation_digest":"sha256:54ac9fa15c0366ffcd29e81ff116c61a9f1ed6a243338d584f2170f4eabe8782","observation_id":"71fddd0e-e487-4fac-85eb-8e36dc2e83ba","resolution":{"observed_at":"2026-08-03T12:48:35.811131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-08-02T20:21:31.075670Z","title":"Carllava: Vi- sion language models for camera-only closed-loop driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23499","last_updated":"2026-06-09T07:27:50Z","snapshot_observed_at":"2026-08-06T08:18:27.268856Z","submitted_at":"2026-02-26T21:16:20Z","title":"TaCarla: A comprehensive benchmarking dataset for end-to-end autonomous driving","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:21:31.075670Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2602.23499"},"observation_digest":"sha256:95f8411b5ebcc392d824ce6a90e6f800bfa058df49260fd6a9d864e891558520","observation_id":"989695e6-72a6-4d0a-8ec7-4a54304ae37a","resolution":{"observed_at":"2026-08-02T20:21:31.075670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2604.00813","last_updated":"2026-04-24T15:37:17Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T12:21:26Z","title":"DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T22:59:57.744015Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2604.00813"},"observation_digest":"sha256:ecbc9bb13fdff0409eec5129b1f71ec3611ac8dc48064c0486b857fb819be966","observation_id":"89353404-a066-42c3-8092-3df05a1a6272","resolution":{"observed_at":"2026-05-13T23:03:25.120064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2605.10564","last_updated":"2026-05-11T13:36:51Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T13:36:51Z","title":"DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T04:13:37.421188Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2605.10564"},"observation_digest":"sha256:ab67f05a18fe9ed689978ab85fa1442802b18bb860faf2db4bd663e209734f22","observation_id":"0c567676-f9eb-4692-ae88-df2d94edf05a","resolution":{"observed_at":"2026-05-12T06:31:25.869965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2605.22089","last_updated":"2026-05-21T07:31:49Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T07:31:49Z","title":"LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T07:37:11.292270Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2605.22089"},"observation_digest":"sha256:a820001bef62ab4dd116dd6f741792acccaa420e546ff153467078dcc8cbd11d","observation_id":"091db9d8-e3fb-4eb6-b07a-abe8e2cbf683","resolution":{"observed_at":"2026-05-22T07:41:15.037981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2606.12396","last_updated":"2026-06-10T17:57:06Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:57:06Z","title":"VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:51.407286Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2606.12396"},"observation_digest":"sha256:d768999e0fadb9cc01258d332f6dda9e819126582829558babf0d54107cb71ab","observation_id":"f7076c21-e939-4102-aeda-032225d7d17d","resolution":{"observed_at":"2026-07-03T11:08:03.416062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving","version":1},"cited_work":{"arxiv_id":"2406.10165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10165","snapshot_observed_at":"2026-07-03T16:48:39.563623Z","title":"Carllava: Vision language models for camera- only closed-loop driving.ArXiv, abs/2406.10165","venue":null,"work_id":"d4fa1cdc-1711-40d0-b9d3-042d686c141f","year":2024},"citing_paper":{"arxiv_id":"2607.01658","last_updated":"2026-07-02T03:34:32Z","snapshot_observed_at":"2026-08-06T09:28:15.995609Z","submitted_at":"2026-07-02T03:34:32Z","title":"Teaching Vision-Language-Action Models What to See and Where to Look","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-03T16:42:13.520913Z"},"links":{"cited_paper":"/paper/2406.10165","citing_paper":"/paper/2607.01658"},"observation_digest":"sha256:de0a1f30957e5d0529d65147a751e16d8a59afebdf3a8ca4427e6cbcf2ff5c09","observation_id":"4843126b-cb6e-4163-8a59-290a4e8d47e7","resolution":{"observed_at":"2026-07-03T16:48:39.564964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10165/citation-record","integrity":"/paper/2406.10165/integrity","json":"/paper/2406.10165/citation-record.json","paper":"/paper/2406.10165"},"outbound":[],"paper":{"arxiv_id":"2406.10165","last_updated":"2024-06-14T16:35:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:35:47Z","title":"CarLLaVA: Vision language models for camera-only closed-loop driving"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2406.10165."}