{"as_of":"2026-08-19T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:149bd8caea40830a065e8524d50851dc44a3ad33bada8943e8b9459993b6aceb","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:26:15.704069Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:06:33.852576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:48:39.596474Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2512.03370","last_updated":"2026-04-10T02:11:22Z","snapshot_observed_at":"2026-08-14T03:23:08.794147Z","submitted_at":"2025-12-03T02:06:09Z","title":"ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T03:24:32.577420Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2512.03370"},"observation_digest":"sha256:1ff9c221a9f42da2b3b0eec1f3e2e917f1b731afd0c95f57851a3c9a7b5330f7","observation_id":"5f1683f6-57be-4be2-9d80-8e61963892de","resolution":{"observed_at":"2026-05-17T03:28:58.098776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2602.22667","last_updated":"2026-05-18T07:52:01Z","snapshot_observed_at":"2026-08-17T01:22:08.210180Z","submitted_at":"2026-02-26T06:37:43Z","title":"Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T11:50:37.423645Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2602.22667"},"observation_digest":"sha256:e448334a6bf997727aa72f1e4e1224b7b393a11c8c1a8230f23342d5f55186a2","observation_id":"9f063d58-4fb3-4dd6-8835-ef025ac71ba9","resolution":{"observed_at":"2026-05-21T11:54:09.204266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Occvla: Vision-language-action model with implicit 3d occupancy supervision.CoRR, abs/2509.05578, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:7cfaae35e8aaaf8fcc1608046a4a32a2eb02d389e8427fef84b0fb6deb75e498","observation_id":"5ffcdbe2-573d-4277-9544-3875d8f2d94a","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2605.05072","last_updated":"2026-05-11T03:18:21Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:09:13Z","title":"Height-Guided Projection Reparameterization for Camera-LiDAR Occupancy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T17:24:36.149795Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2605.05072"},"observation_digest":"sha256:bb513e050b09ff73638aa3a7eeda864d9357854afcb7e477ff4ec96e5f7a0031","observation_id":"129cd057-4381-4156-be54-a34a21c1153c","resolution":{"observed_at":"2026-05-11T17:36:06.388360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2605.05072","last_updated":"2026-05-11T03:18:21Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:09:13Z","title":"Height-Guided Projection Reparameterization for Camera-LiDAR Occupancy","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:02:19.480937Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2605.05072"},"observation_digest":"sha256:39b899295edb1d2de712ff95218a5f2003db36a7b0b86f7f799d810a4c91803f","observation_id":"698acbad-fd1c-4fd1-8a42-201e9edaf122","resolution":{"observed_at":"2026-05-12T06:41:43.960049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2605.27038","last_updated":"2026-05-26T13:56:31Z","snapshot_observed_at":"2026-08-16T13:12:38.040448Z","submitted_at":"2026-05-26T13:56:31Z","title":"TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T17:42:49.902997Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2605.27038"},"observation_digest":"sha256:3c12e1040f779e7914a375486f9311bdbc0d87d794e01ccbeed0aaafa65bacf9","observation_id":"207aa84a-c5bf-4bc7-96ca-eaf65bf772c0","resolution":{"observed_at":"2026-06-29T17:43:45.704784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2606.05008","last_updated":"2026-06-03T15:28:57Z","snapshot_observed_at":"2026-08-06T07:23:12.183499Z","submitted_at":"2026-06-03T15:28:57Z","title":"M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T06:16:07.090870Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2606.05008"},"observation_digest":"sha256:90157d817ab574771c90f8ae610ed22365e55b4d69902d940a3f4a8279269810","observation_id":"673c8019-968e-4da9-89d5-713c18b52b3e","resolution":{"observed_at":"2026-07-02T08:16:47.758810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":"2509.05578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-07-03T16:48:39.596474Z","title":"Oc- cvla: Vision-language-action model with implicit 3d occu- pancy supervision","venue":null,"work_id":"9a241737-7f79-4923-9916-3869db2905d0","year":2025},"citing_paper":{"arxiv_id":"2607.01658","last_updated":"2026-07-02T03:34:32Z","snapshot_observed_at":"2026-08-18T07:54:51.714693Z","submitted_at":"2026-07-02T03:34:32Z","title":"Teaching Vision-Language-Action Models What to See and Where to Look","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-03T16:42:13.520913Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2607.01658"},"observation_digest":"sha256:0e1da52865ee8af207bd2bad15fd89489d9428fdaaf8da1ade0a8053be1cef18","observation_id":"1a5a9899-08ed-4210-ba36-436a01495968","resolution":{"observed_at":"2026-07-03T16:48:39.597762Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05578","snapshot_observed_at":"2026-08-02T05:06:33.852576Z","title":"Occvla: Vision-language- action model with implicit 3d occupancy supervision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13481","last_updated":"2026-07-15T06:21:25Z","snapshot_observed_at":"2026-08-14T09:20:16.534976Z","submitted_at":"2026-07-15T06:21:25Z","title":"GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:06:33.852576Z"},"links":{"cited_paper":"/paper/2509.05578","citing_paper":"/paper/2607.13481"},"observation_digest":"sha256:d893c241c62af643cb57bc3339a5882eff94b3fdba24014ac992825a82f46d81","observation_id":"8d12a04d-ee7a-4419-9c93-78de1d3c9166","resolution":{"observed_at":"2026-08-02T05:06:33.852576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.05578/citation-record","integrity":"/paper/2509.05578/integrity","json":"/paper/2509.05578/citation-record.json","paper":"/paper/2509.05578"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-15T16:26:15.585479Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.585479Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:82bdd2bcc6f2df517bdb2b2abde86b8642995e9e97000f2e03204ea5f9209a72","observation_id":"a4b40f5c-cdb8-4a1f-95d9-83410d760f0d","resolution":{"observed_at":"2026-08-15T16:26:15.585479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12077","last_updated":"2023-08-24T08:15:35Z","snapshot_observed_at":"2026-08-16T15:46:27.626392Z","submitted_at":"2023-03-21T17:59:22Z","title":"VAD: Vectorized Scene Representation for Efficient Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12077","snapshot_observed_at":"2026-08-15T16:26:15.602694Z","title":"Alex H Lang, Sourabh V ora, Holger Caesar, Lubing Zhou, Jiong Yang, and Oscar Beijbom","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.602694Z"},"links":{"cited_paper":"/paper/2303.12077","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:213db6f690eac7dfb5d2ca70e71df1226a1c8147756eeb7b4fe285cde17f3310","observation_id":"819333d0-c886-42c1-9d99-6b3e344ae725","resolution":{"observed_at":"2026-08-15T16:26:15.602694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18140","last_updated":"2024-02-28T08:03:34Z","snapshot_observed_at":"2026-08-16T18:13:29.672838Z","submitted_at":"2024-02-28T08:03:34Z","title":"OccTransformer: Improving BEVFormer for 3D camera-only occupancy prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18140","snapshot_observed_at":"2026-08-15T16:26:15.614268Z","title":"Occtransformer: Improving bevformer for 3d camera-only occupancy prediction.arXiv preprint arXiv:2402.18140, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.614268Z"},"links":{"cited_paper":"/paper/2402.18140","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:88fb5988fbab984001957180462c8c2a8c58766d630c67bb1374b73918e0a625","observation_id":"73d694dd-ebb0-4090-a1af-96ff63c461aa","resolution":{"observed_at":"2026-08-15T16:26:15.614268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T16:26:15.619993Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.619993Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:e18fd5aaeffb06d67aec702ae9499a3e0de555a3e07febb843cc78d930e1c601","observation_id":"9d3f5af6-f056-44de-949c-e41152da9c8f","resolution":{"observed_at":"2026-08-15T16:26:15.619993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:26:16.205357Z","title":"URLhttps: //aclanthology.org/2023.emnlp-demo.13","venue":null,"work_id":"15220228-abeb-40ca-a98a-5db4d69bc68c","year":2023},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.634695Z"},"links":{"citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:a4e25741665ad8758d0a8c326ff9b8eb3baee44070fe8c5bcff21eec3d97f259","observation_id":"fa17e969-aa3e-46e7-b6e7-506c6ea1da85","resolution":{"observed_at":"2026-08-15T16:26:16.210402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-15T16:26:15.649617Z","title":"Xiaoyu Tian, Tao Jiang, Longfei Yun, Yucheng Mao, Huitong Yang, Yue Wang, Yilun Wang, and Hang Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.649617Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:e8cb954c0411fb181e5da2793bc97ecd9bb289ef59196f9ce7879c572de7f46a","observation_id":"25d3b5ef-29ff-4d55-80cb-aa3b36177bc3","resolution":{"observed_at":"2026-08-15T16:26:15.649617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-15T16:26:15.654582Z","title":"Xiaoyu Tian, Junru Gu, Bailin Li, Yicheng Liu, Yang Wang, Zhiyong Zhao, Kun Zhan, Peng Jia, Xianpeng Lang, and Hang Zhao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.654582Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:abb2b1e9b2de6b8c222b096c190fa2713381ba231407d9dd9cc51b3ed17fef72","observation_id":"082a111f-0e5b-48a0-b8b0-563b5fea803a","resolution":{"observed_at":"2026-08-15T16:26:15.654582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T16:26:15.659943Z","title":"Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, and Jose M Alvarez","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.659943Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:1e8a93df1cda86470542b6d7b87efa6a74f8f29647e19f3b8ab98b291005914a","observation_id":"6e7633ad-96e6-4c6f-afa0-43398143f7d1","resolution":{"observed_at":"2026-08-15T16:26:15.659943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:26:15.664533Z","title":"12 Preprint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.664533Z"},"links":{"citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:f78cdf2c44b14c87778a97606843c3992a08733e4a98f69f963b71a56917b55c","observation_id":"9529e215-2148-429d-b64d-a27a92768539","resolution":{"observed_at":"2026-08-15T16:26:15.664533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03272","last_updated":"2024-09-05T06:30:01Z","snapshot_observed_at":"2026-08-18T19:22:28.145577Z","submitted_at":"2024-09-05T06:30:01Z","title":"OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03272","snapshot_observed_at":"2026-08-15T16:26:15.669024Z","title":"Occllama: An occupancy-language-action generative world model for autonomous driving.arXiv preprint arXiv:2409.03272,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.669024Z"},"links":{"cited_paper":"/paper/2409.03272","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:b5d5752714eaa65b6f17cc7354c62965952e527239cd390553c66f6b0993b43c","observation_id":"9c5496ad-3f5b-4efd-bd2b-2e6cf53373d4","resolution":{"observed_at":"2026-08-15T16:26:15.669024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08481","last_updated":"2023-06-14T17:10:00Z","snapshot_observed_at":"2026-08-16T15:39:48.704577Z","submitted_at":"2023-04-17T17:58:40Z","title":"Neural Map Prior for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2304.08481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.08481","snapshot_observed_at":"2026-08-15T16:26:15.896511Z","title":"Neural Map Prior for Autonomous Driving","venue":"cs.CV","work_id":"2cead82b-b7b3-4e1f-9259-249ab549e4bc","year":2023},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.673775Z"},"links":{"cited_paper":"/paper/2304.08481","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:40f7653d58799d0b27e7a8748394c905d5d5b7dd99bf77554d2818a3328fe2ed","observation_id":"a4577109-337f-4ca3-a1f6-62ee9d179133","resolution":{"observed_at":"2026-08-15T16:26:15.903844Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01412","last_updated":"2024-11-09T02:41:02Z","snapshot_observed_at":"2026-08-16T14:55:46.020378Z","submitted_at":"2023-10-02T17:59:52Z","title":"DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01412","snapshot_observed_at":"2026-08-15T16:26:15.678713Z","title":"Senqiao Yang, Jiaming Liu, Ray Zhang, Mingjie Pan, Zoey Guo, Xiaoqi Li, Zehui Chen, Peng Gao, Yandong Guo, and Shanghang Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.678713Z"},"links":{"cited_paper":"/paper/2310.01412","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:8aa829e42588326cfc16d2eb838d8856ee13d9d99b13c8c6694631bb33280a74","observation_id":"88242e4b-b939-4d61-8a3c-37e140382b10","resolution":{"observed_at":"2026-08-15T16:26:15.678713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-08-16T14:32:29.697633Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-15T16:26:15.684056Z","title":"Baijun Ye, Minghui Qin, Saining Zhang, Moonjun Gong, Shaoting Zhu, Zebang Shen, Luan Zhang, Lu Zhang, Hao Zhao, and Hang Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.684056Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:dbf1469d81a3f11ecb2f13bd33040dbcc795462ad04308d91ec62d2827f11298","observation_id":"60ce2586-7d5f-403a-87c1-2c073a800c28","resolution":{"observed_at":"2026-08-15T16:26:15.684056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10430","last_updated":"2023-10-22T02:45:33Z","snapshot_observed_at":"2026-07-06T15:28:49.253125Z","submitted_at":"2023-05-17T17:59:11Z","title":"Rethinking the Open-Loop Evaluation of End-to-End Autonomous Driving in nuScenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10430","snapshot_observed_at":"2026-08-15T16:26:15.689086Z","title":"Rethinking the open-loop evaluation of end-to-end autonomous driving in nuscenes.arXiv preprint arXiv:2305.10430,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.689086Z"},"links":{"cited_paper":"/paper/2305.10430","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:3d9ed5d0d2ccdce9c2d90b61f80145d18ef3169484956e89959f6c469a879605","observation_id":"6b063f9d-131a-4842-b71c-41bda42fa56b","resolution":{"observed_at":"2026-08-15T16:26:15.689086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05316","last_updated":"2023-04-11T16:15:50Z","snapshot_observed_at":"2026-08-16T15:41:14.793093Z","submitted_at":"2023-04-11T16:15:50Z","title":"OccFormer: Dual-path Transformer for Vision-based 3D Semantic Occupancy Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05316","snapshot_observed_at":"2026-08-15T16:26:15.693715Z","title":"Occformer: Dual-path transformer for vision-based 3d semantic occupancy prediction.arXiv preprint arXiv:2304.05316,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.693715Z"},"links":{"cited_paper":"/paper/2304.05316","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:137da402eab005c534243a1c4a1dc27a1457d773533790b8f41ffab6565bcae6","observation_id":"9a38f73e-77f9-459d-b1a7-197c79fd9cbf","resolution":{"observed_at":"2026-08-15T16:26:15.693715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20879","last_updated":"2026-04-20T03:40:15Z","snapshot_observed_at":"2026-08-06T17:23:39.545553Z","submitted_at":"2025-07-28T14:33:15Z","title":"DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20879","snapshot_observed_at":"2026-08-15T16:26:15.699566Z","title":"Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Borui Zhang, Yueqi Duan, and Jiwen Lu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.699566Z"},"links":{"cited_paper":"/paper/2507.20879","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:c1cd388078e2c100d12b080c0c487ca958e3ae2928f91b85f2d4a6db968a11d9","observation_id":"eb094116-c308-4135-9b69-edf76732ea58","resolution":{"observed_at":"2026-08-15T16:26:15.699566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:26:15.704069Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.704069Z"},"links":{"citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:27ad9b4278801ea639c7c09c60fe049288dfdf9d0d4603620c15361734de0831","observation_id":"f5f2124b-ce8d-45d3-99ee-fc272b619a11","resolution":{"observed_at":"2026-08-15T16:26:15.704069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14836","last_updated":"2024-02-20T05:04:58Z","snapshot_observed_at":"2026-08-16T15:30:18.987296Z","submitted_at":"2023-05-24T07:40:50Z","title":"NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14836","snapshot_observed_at":"2026-08-15T16:26:15.639601Z","title":"Nuscenes-qa: A multi- modal visual question answering benchmark for autonomous driving scenario.arXiv preprint arXiv:2305.14836,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.639601Z"},"links":{"cited_paper":"/paper/2305.14836","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:7d2dd42c037ba2eef2415c7dbe96228b60e9720a90ecceb1a56edaac4b0c6553","observation_id":"18b6d784-41e2-4682-ad8a-83096becfd5e","resolution":{"observed_at":"2026-08-15T16:26:15.639601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13959","last_updated":"2024-05-06T15:14:22Z","snapshot_observed_at":"2026-08-16T15:45:38.834701Z","submitted_at":"2023-03-24T12:33:44Z","title":"Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13959","snapshot_observed_at":"2026-08-15T16:26:15.607853Z","title":"Stereoscene: Bev-assisted stereo matching empowers 3d seman- tic scene completion.arXiv preprint arXiv:2303.13959, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.607853Z"},"links":{"cited_paper":"/paper/2303.13959","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:4a3b990b54f800cce456586b23e0684683263b981646875fcb532c2d9d39cd16","observation_id":"e9d7a048-9be0-4e12-a0d1-5dcbd3522690","resolution":{"observed_at":"2026-08-15T16:26:15.607853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:26:16.221529Z","title":"Adapters: A unified li- brary for parameter-efficient and modular transfer learning","venue":null,"work_id":"5f6f24fe-986c-4e79-abcb-41fb71f8693b","year":2023},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.629681Z"},"links":{"citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:0bad98389a676bce15b4362244a6369651ca126269dd58f8bc278e8c91a7aca0","observation_id":"805e8997-b38a-4cd5-b1b7-7b2e99b2ea31","resolution":{"observed_at":"2026-08-15T16:26:16.226552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07601","last_updated":"2022-07-18T02:36:43Z","snapshot_observed_at":"2026-08-16T18:12:51.144147Z","submitted_at":"2022-07-15T16:57:43Z","title":"ST-P3: End-to-end Vision-based Autonomous Driving via Spatial-Temporal Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07601","snapshot_observed_at":"2026-08-15T16:26:15.591617Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.591617Z"},"links":{"cited_paper":"/paper/2207.07601","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:54a9d99fc308a292fd617e13e397aa964b1c8d464e5cbe18508d4bcdd939e98c","observation_id":"089e9a7c-596e-4ced-a9e9-c6c33fdb4d75","resolution":{"observed_at":"2026-08-15T16:26:15.591617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07817","last_updated":"2023-03-02T16:41:45Z","snapshot_observed_at":"2026-08-16T15:55:05.947853Z","submitted_at":"2023-02-15T17:58:10Z","title":"Tri-Perspective View for Vision-Based 3D Semantic Occupancy Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07817","snapshot_observed_at":"2026-08-15T16:26:15.597320Z","title":"Jyh-Jing Hwang, Runsheng Xu, Hubert Lin, Wei-Chih Hung, Jingwei Ji, Kristy Choi, Di Huang, Tong He, Paul Covington, Benjamin Sapp, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.597320Z"},"links":{"cited_paper":"/paper/2302.07817","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:683aa2df459a6e2986981c53737c83f2331c1d0b60357f029e3a89b29c8b630f","observation_id":"eea1e51a-4e1e-435e-b1f1-86b1b4a37f72","resolution":{"observed_at":"2026-08-15T16:26:15.597320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T16:26:15.625080Z","title":"11 Preprint","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.625080Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:844e0ea4b277f45524013c856b30bd4043f8eb40821a271a738e511496dd74c2","observation_id":"a37b57bd-8291-4f65-96e3-5f1846e09a0d","resolution":{"observed_at":"2026-08-15T16:26:15.625080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-17T03:15:27.866249Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-15T16:26:15.644541Z","title":"Chonghao Sima, Katrin Renz, Kashyap Chitta, Li Chen, Hanxue Zhang, Chengen Xie, Ping Luo, Andreas Geiger, and Hongyang Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T16:26:15.644541Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.05578"},"observation_digest":"sha256:4e3bad4ee4b46a4a94a983531c855117bea37bd5140bd5eae66421c9ca8fdada","observation_id":"fc05f3a1-bb1c-445f-8eda-3a47119e9884","resolution":{"observed_at":"2026-08-15T16:26:15.644541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.05578","last_updated":"2025-09-06T03:47:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T18:13:28.207432Z","submitted_at":"2025-09-06T03:47:21Z","title":"OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 9 inbound Pith citation observations for arXiv:2509.05578."}