{"as_of":"2026-08-10T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffbd7401d6881eda77a6960fc8733d207c61b2905465790f20c6eaa0c6b99da7","coverage":[{"denominator":144,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:52:06.559453Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08302/citation-record","integrity":"/paper/2509.08302/integrity","json":"/paper/2509.08302/citation-record.json","paper":"/paper/2509.08302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.955693Z","title":"3d object detection for autonomous driving: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.955693Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c6d75de2e28623cb503e416d21c2d094fa6d7c423db2eea68e931483bcfec15e","observation_id":"f9257e52-cd33-479b-abe0-31b69599653d","resolution":{"observed_at":"2026-08-04T20:52:05.955693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.961813Z","title":"Vision-based semantic segmentation in scene understanding for autonomous driving: Recent achievements, challenges, and out- looks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.961813Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7eccba1558e622c9c007c1f042b09b95779d4d4cff207dc293c1a02eb771125d","observation_id":"c764dff8-139f-46ed-bdb8-23c5de0b39fb","resolution":{"observed_at":"2026-08-04T20:52:05.961813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.966653Z","title":"A review of deep learning-based visual multi-object tracking algorithms for autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.966653Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9bf7cc2b4e56cd4147b3df53c4e339e9acfc52701ea5680f273c25da4f848684","observation_id":"5f403c37-4c36-41ed-8fb0-76bce0f8ac70","resolution":{"observed_at":"2026-08-04T20:52:05.966653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.972339Z","title":"Towards long-tailed 3d detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.972339Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:cc178262e04311fe38f26247655c41797460b50b5bd60f06065263e91e98303a","observation_id":"d65b8950-a850-4da0-acd1-0ccb76d5e3ae","resolution":{"observed_at":"2026-08-04T20:52:05.972339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-04T20:52:05.979955Z","title":"On the opportuni- ties and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.979955Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e5bd0bc74edc11f995c2ae52aede0e2dd76793507cdf3fd9e53d7c829bcf6ae6","observation_id":"e465f32f-7cec-4df0-ad99-fe71a4c90dd1","resolution":{"observed_at":"2026-08-04T20:52:05.979955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08045","last_updated":"2024-01-16T01:57:24Z","snapshot_observed_at":"2026-08-03T22:56:13.995956Z","submitted_at":"2024-01-16T01:57:24Z","title":"Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08045","snapshot_observed_at":"2026-08-04T20:52:05.987906Z","title":"Forging vision foundation models for autonomous driving: Challenges, methodologies, and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.987906Z"},"links":{"cited_paper":"/paper/2401.08045","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d6dcfb46f5a4f983dc8ccce93a5e0d804a4f27c5f4fabd303d310fbf3950800e","observation_id":"fae8c30c-c100-4f15-9b78-df95426c161b","resolution":{"observed_at":"2026-08-04T20:52:05.987906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12144","last_updated":"2024-01-05T01:58:58Z","snapshot_observed_at":"2026-08-02T14:54:39.196220Z","submitted_at":"2023-11-20T19:45:27Z","title":"Applications of Large Scale Foundation Models for Autonomous Driving","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12144","snapshot_observed_at":"2026-08-04T20:52:05.993544Z","title":"Applications of large scale foundation models for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.993544Z"},"links":{"cited_paper":"/paper/2311.12144","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:adbf29f4920c5343154b05d77be3c56f04c633597f252d2d4caea1020b5838ad","observation_id":"376c9556-8aff-430c-8e30-75316db34504","resolution":{"observed_at":"2026-08-04T20:52:05.993544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01105","last_updated":"2024-09-05T03:38:08Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:44:59Z","title":"A Survey for Foundation Models in Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01105","snapshot_observed_at":"2026-08-04T20:52:05.999643Z","title":"A survey for foundation models in au- tonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.999643Z"},"links":{"cited_paper":"/paper/2402.01105","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ed21f8f3a5f503dd5d70697be891ab4a1543307941d6423ac1fbb75604c62526","observation_id":"d0e341af-95d9-4c15-8f84-6db07cbdc06b","resolution":{"observed_at":"2026-08-04T20:52:05.999643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.006340Z","title":"Prospective role of foundation models in advancing autonomous vehicles,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.006340Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d06d42171dd502374273bcf9ab9dcaff8bcf3139af1ea3e240c7bbaf3a228e06","observation_id":"1888f426-0ae8-4a6a-a30a-965628e0aa72","resolution":{"observed_at":"2026-08-04T20:52:06.006340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01043","last_updated":"2024-08-12T11:53:28Z","snapshot_observed_at":"2026-08-10T06:32:51.712930Z","submitted_at":"2023-11-02T07:23:33Z","title":"LLM4Drive: A Survey of Large Language Models for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01043","snapshot_observed_at":"2026-08-04T20:52:06.018250Z","title":"Llm4drive: A survey of large language models for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.018250Z"},"links":{"cited_paper":"/paper/2311.01043","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:db0726c443d6153a51236ed350d943dd6c6f2a68c7c91df7f825c9e06af6eabc","observation_id":"044ac690-0940-4526-a418-a6c219682e59","resolution":{"observed_at":"2026-08-04T20:52:06.018250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.023527Z","title":"Vision language models in autonomous driving: A survey and outlook,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.023527Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:1126c6a59637dd2000feca4aec54cd0f86bdb5ac3fb4d50efd0592b4348db68d","observation_id":"d9f5dca6-921b-453c-bc8c-5a1e01fa2b39","resolution":{"observed_at":"2026-08-04T20:52:06.023527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.032288Z","title":"A simple framework for contrastive learning of vi- sual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.032288Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9a2ec1d214cc247d8ff417925633886de567c914b29a06036816d78154732149","observation_id":"de83e643-f1ad-4c54-9db8-23edaf01ae9f","resolution":{"observed_at":"2026-08-04T20:52:06.032288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.037588Z","title":"Momentum contrast for unsupervised visual repre- sentation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.037588Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:44c7c837e2087af6ff67d372d7ecddc7e6e4d32e92d25f285e94276425505777","observation_id":"5bad0149-16d2-4d99-a209-330436757d0d","resolution":{"observed_at":"2026-08-04T20:52:06.037588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-04T20:52:06.043634Z","title":"Improved baselines with momentum contrastive learning,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.043634Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:252b785fdf567e27fd0754aa9497148f49059b002f66fdfc6c19a0e6937373c0","observation_id":"a1f52ee6-a4a5-4f23-a82e-2645a82f60fb","resolution":{"observed_at":"2026-08-04T20:52:06.043634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.049114Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.049114Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ffa94362ab3828d94c99f4baf473ee20117036abdbc245e7a1581b8c92140446","observation_id":"2925c295-deca-4236-ad6e-2b8327b9cd3c","resolution":{"observed_at":"2026-08-04T20:52:06.049114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T20:52:06.054078Z","title":"An image is worth 16x16 words: Transformers for image recogni- tion at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.054078Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:974b9e62649be82d02f6ca36197f4a21a4eeec6423ce743f28dde34a7b4f9491","observation_id":"d69169fb-6421-4219-bfed-0898ef033262","resolution":{"observed_at":"2026-08-04T20:52:06.054078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-04T20:52:06.060395Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.060395Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:daeb3147ef63a98e9cc3ef012213f3906d968e2a7c985962d5e4248462cf0241","observation_id":"b399a9ea-240a-4d5c-a12f-56223cef3f85","resolution":{"observed_at":"2026-08-04T20:52:06.060395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.070561Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.070561Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c35f57981885feef42d5c40bc1b35bb95f831d1f1829b5cef9345cae862c4a31","observation_id":"7a598d00-ea11-4715-a1d1-607a76e0c35d","resolution":{"observed_at":"2026-08-04T20:52:06.070561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.078479Z","title":"Self- training with noisy student improves imagenet classi- fication,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.078479Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:1eafa33dd8ef5b51c093ce100ec48358f1cdd6eb3bbe772c6f8afd579885a40c","observation_id":"75a8cb68-f62b-4daa-a0b1-342804835a49","resolution":{"observed_at":"2026-08-04T20:52:06.078479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.087477Z","title":"Bootstrap your own latent-a new approach to self- supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.087477Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ddad9cc563402858ee7a333c3067e781d3e8cf56bf8fe7708cc3e03240a1245f","observation_id":"4ba07694-93b0-44ed-9bf7-c19fb1310825","resolution":{"observed_at":"2026-08-04T20:52:06.087477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.093522Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.093522Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e6d5f129064adf68ea2780d0d84642eeb88dd6896e66e8eb0f59408f0d14facd","observation_id":"29de20c4-8203-44df-8485-5d5e16fd24b2","resolution":{"observed_at":"2026-08-04T20:52:06.093522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.098456Z","title":"Structure-from- motion revisited,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.098456Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9acd85ca49b5e2cfce39a056441b7ac90e210f40d97439bd86cb1474990c4a28","observation_id":"997aae34-57c4-4592-92e7-b5ab8cd71ea4","resolution":{"observed_at":"2026-08-04T20:52:06.098456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.103056Z","title":"Multi-view stereo: A tutorial,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.103056Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b878991e43babc6a0bf3d86965309c7c695d2e9dba10f4d2346710c7ffc8ff1a","observation_id":"d9c70e9f-8a34-4c5f-b79f-5ae34ecf8564","resolution":{"observed_at":"2026-08-04T20:52:06.103056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.108496Z","title":"Past, present, and future of simultaneous localization and mapping: Toward the robust-perception age,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.108496Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b4937279657100be2398c2cc15e697cab4bd5a71be9b1252e0ea092295c13da6","observation_id":"4546bf8d-89ba-441f-a2e0-d6ccdc165bf5","resolution":{"observed_at":"2026-08-04T20:52:06.108496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.114614Z","title":"3d-r2n2: A unified approach for single and multi- view 3d object reconstruction,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.114614Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c51b1d303f09c60f67b789d0028cfd29d2aa3d365b56bd30743f1f7624e9f4f3","observation_id":"96ab3df6-150f-4ccf-a4c3-f3435abbd036","resolution":{"observed_at":"2026-08-04T20:52:06.114614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.121630Z","title":"Predicting depth, surface normals and semantic labels with a common multi- scale convolutional architecture,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.121630Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:6be9bbf1cb38988953d434d9487e31bf3b89ddf7ceba4801ef35e6a8b33013e6","observation_id":"0e257a96-f1ae-48f4-8d41-bbbc38e21073","resolution":{"observed_at":"2026-08-04T20:52:06.121630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.126104Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.126104Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:53575433d029473a8d8cea4914ddd0caaf447407f9deb094493ab437d79b57f5","observation_id":"bbb8a972-b932-4b27-96bd-8e63b568c99d","resolution":{"observed_at":"2026-08-04T20:52:06.126104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.131796Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.131796Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9750e850d501524ca52d57278ff13c4ea90adb82dc54e3cccdd40a7997f5e58a","observation_id":"1dfc9792-243d-4bc1-8da5-8ebb0307a6e2","resolution":{"observed_at":"2026-08-04T20:52:06.131796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-04T20:52:06.136278Z","title":"Yolov3: An incremen- tal improvement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.136278Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e2bb62a5d3fc29c59d207a96b075be4c6c0587297b6c97550073c490c5da220a","observation_id":"7465bef0-9337-46c8-912c-65294b4f72fb","resolution":{"observed_at":"2026-08-04T20:52:06.136278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.141344Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.141344Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b7fa0e9bfc5ae00b93b4b50fd74009c01b8bb2cf1e78abeb71b4932a4b183058","observation_id":"8d63dc12-8850-4364-8ce0-a4ae4ccea62f","resolution":{"observed_at":"2026-08-04T20:52:06.141344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:52:06.146791Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.146791Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:20bb1accdf5a56ca14617677b0f1e647834c24c5db897a4e288cdffee310624d","observation_id":"6bbaf5a6-75be-4b30-b814-8e055348648e","resolution":{"observed_at":"2026-08-04T20:52:06.146791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.151255Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.151255Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:fc5b1705ce6896e1d0f9e30d6fd9bd19ae3e3a15764905a054df11f70d0f9ba6","observation_id":"306ef2ef-2bec-429d-880a-6fdb354c8660","resolution":{"observed_at":"2026-08-04T20:52:06.151255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.156549Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.156549Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f340abd991b9cc9993101b90bca9aefb9537a960295123978a51f5d326e968a1","observation_id":"808ca6a7-f1cc-4b29-828d-6a2e237583af","resolution":{"observed_at":"2026-08-04T20:52:06.156549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T20:52:06.161060Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.161060Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d25f1ea6d8916822a0880e8ae51fd550494501c536c1ec29441db1d479913955","observation_id":"3b690062-15d8-4053-9c37-476f70e7730b","resolution":{"observed_at":"2026-08-04T20:52:06.161060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.165537Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.165537Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7ebff2653e00a024cb53ac0714801c01ee2ae904e6249f223c0943b7da12deb2","observation_id":"ed7d736d-bf60-42b9-b47b-a6ce60c45e49","resolution":{"observed_at":"2026-08-04T20:52:06.165537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.170279Z","title":"Grounding dino: Marrying dino with grounded pre-training for VOLUME 00, 2024 27 Authoret al.: Preparation of Papers for IEEE OPEN JOURNALS open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.170279Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:16a712125696e2578368b2cfcfa60db2dd7f3d86a6f66bce70af77a188c06a45","observation_id":"491988f0-11c5-474c-9803-79e69ab57e2d","resolution":{"observed_at":"2026-08-04T20:52:06.170279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.174614Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.174614Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7d8826eb56709ecbe57805aec9fc378924e11e90b4a39e9dbf8f4af16d97aac6","observation_id":"c087e1f2-c3d8-45da-b1b0-21f0d6b1d44b","resolution":{"observed_at":"2026-08-04T20:52:06.174614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.179142Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.179142Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:570eabce994a8632a805fef43a4bf891f40c6cff5f53dcd4c7365dd8d672b72a","observation_id":"45984016-7677-47d3-96dd-fbc7e6d7a997","resolution":{"observed_at":"2026-08-04T20:52:06.179142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.183470Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.183470Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e9d1cc7219ceccd240871ec5c41a156d5c341f17b9b5cd5b75b04eb9c940d905","observation_id":"06588573-edd6-4f41-82f2-8f80df7780c8","resolution":{"observed_at":"2026-08-04T20:52:06.183470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.188424Z","title":"3d shape generation and completion through point-voxel diffusion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.188424Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:635d741a4a0da1cd0b6193657f1ae2d857b40fd4143cf4d9c68abd871deaad4d","observation_id":"cb6f5e0e-29a8-4af9-88d8-6d20ad38a38b","resolution":{"observed_at":"2026-08-04T20:52:06.188424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.193245Z","title":"Diffusion-based signed distance fields for 3d shape generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.193245Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ef4660121b880603cc45412d6597defa183b4288c40c5bca3328f6abc52e2999","observation_id":"254311b5-9d0d-4818-b96f-c978d422a22f","resolution":{"observed_at":"2026-08-04T20:52:06.193245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.198082Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.198082Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:79875bbd1c7903db21243498dcc73959930c58579284db79e5571381c15cb0de","observation_id":"1c0950a9-d402-41ed-875f-898878a7fcf2","resolution":{"observed_at":"2026-08-04T20:52:06.198082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.204799Z","title":"Image-to-lidar self-supervised distilla- tion for autonomous driving data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.204799Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d3bfd15a6b7e13b6887259675a95cdb8c46ee825124e188094a484cd89fa5c6a","observation_id":"a6b6b936-605d-4ed9-a1ac-5a8190f8a493","resolution":{"observed_at":"2026-08-04T20:52:06.204799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.209914Z","title":"Segment any point cloud sequences by distilling vision foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.209914Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:a7c21ee005c95f4652997f46601f044afd8a08a17e2b43193be34a36d4e3898e","observation_id":"48a87cf9-5322-4f28-b184-8470b2895fb4","resolution":{"observed_at":"2026-08-04T20:52:06.209914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.214452Z","title":"Better call sal: Towards learning to segment anything in lidar,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.214452Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:953791ced8c76b0dc1fc91261acc8e3395ee51bf035f79d0eda80a2841ce676b","observation_id":"6b775d6d-9da4-45eb-9ceb-f1a6ea681d32","resolution":{"observed_at":"2026-08-04T20:52:06.214452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.219199Z","title":"Sam4udass: When sam meets unsupervised domain adaptive semantic segmentation in intelligent ve- hicles,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.219199Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f1dad9441e31e5c490c8dd66fc33b1cd3ac5da342096dafa8c98d7eacaf44e63","observation_id":"6faf96f5-d14a-42f4-b8c5-6b7743b1559d","resolution":{"observed_at":"2026-08-04T20:52:06.219199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.226674Z","title":"Occnerf: Self-supervised multi- camera occupancy prediction with neural radiance fields,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.226674Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:cc03f96db096fb18e7d9f1cccf04914b2f6d3e0bc8a4fc42f40c3c6e816e111c","observation_id":"e9f52271-fced-471d-8acd-cf8a1584d203","resolution":{"observed_at":"2026-08-04T20:52:06.226674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10880","last_updated":"2024-08-20T14:10:44Z","snapshot_observed_at":"2026-08-09T10:38:16.340469Z","submitted_at":"2024-08-20T14:10:44Z","title":"Open 3D World in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2408.10880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10880","snapshot_observed_at":"2026-08-04T20:52:07.498826Z","title":"Open 3D World in Autonomous Driving","venue":"cs.CV","work_id":"ee4898d2-c0a0-4a16-9de9-b115c52cff7b","year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.234374Z"},"links":{"cited_paper":"/paper/2408.10880","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:eb47a569014c942100e5fbcb293e9ae2e9ec5a7c100dc6afb896c0950378dca3","observation_id":"a46554fc-03ac-48d2-9dd0-7cc169d2c97d","resolution":{"observed_at":"2026-08-04T20:52:07.504246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16133","last_updated":"2023-06-14T17:30:54Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T15:07:25Z","title":"OVO: Open-Vocabulary Occupancy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16133","snapshot_observed_at":"2026-08-04T20:52:06.241136Z","title":"Ovo: Open-vocabulary occupancy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.241136Z"},"links":{"cited_paper":"/paper/2305.16133","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:df2910556daeb0ee3c2199ae2b515524f666e1a4eb2b40a76d3c8273f86dc729","observation_id":"f9188c8d-3d07-49f5-bccb-eeb23a512c27","resolution":{"observed_at":"2026-08-04T20:52:06.241136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.246751Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.246751Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:34e35fa07a743030c605add9b64db2a76e058a5649ba5c2cb4f40b3f1378a670","observation_id":"3efc75fb-904e-4f13-b4a2-75e4c755c603","resolution":{"observed_at":"2026-08-04T20:52:06.246751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.251773Z","title":"Vlm2scene: Self- supervised image-text-lidar learning with foundation models for autonomous driving scene understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.251773Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:6251005ba727dfa80ea30deff73dcb2f1fe1ff3e18f74b4564e90c319248587e","observation_id":"1ed4d6d4-5cfb-4759-88dd-7b6a889fd293","resolution":{"observed_at":"2026-08-04T20:52:06.251773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.256601Z","title":"Unsupervised 3d perception with 2d vision-language distillation for autonomous driv- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.256601Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7c26b7d1463cc5b9cc8624637f2908fadde5f7098a1cc9fcd023f6ce5c955b98","observation_id":"04225145-4aa3-4e2d-b62a-7ca4a398a769","resolution":{"observed_at":"2026-08-04T20:52:06.256601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.261543Z","title":"Opensight: A simple open-vocabulary framework for lidar-based object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.261543Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9ccb839c8a728ae097feb129ee291bba6f32a9db8f59dd32766742d270019adc","observation_id":"27d822af-a0f7-4591-9dcb-8509cecbd4bf","resolution":{"observed_at":"2026-08-04T20:52:06.261543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02245","last_updated":"2024-01-29T12:14:04Z","snapshot_observed_at":"2026-07-06T15:37:39.433980Z","submitted_at":"2023-06-04T03:09:21Z","title":"SAM3D: Zero-Shot 3D Object Detection via Segment Anything Model","version":2},"cited_work":{"arxiv_id":"2306.02245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02245","snapshot_observed_at":"2026-08-04T20:52:07.460714Z","title":"SAM3D: Zero-Shot 3D Object Detection via Segment Anything Model","venue":"cs.CV","work_id":"d5524595-1d10-491a-b9e2-4845329ec30f","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.267283Z"},"links":{"cited_paper":"/paper/2306.02245","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9359de165bbf09b9ffbfcd41c658c10e9ac6e1eec268b46ee738e3d3b15358fb","observation_id":"f0edd2f8-565c-4683-b2e1-15f3c2bc8e0a","resolution":{"observed_at":"2026-08-04T20:52:07.465345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-04T20:52:06.272252Z","title":"Gpt- driver: Learning to drive with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.272252Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c060063e771d6a99ed70dc478bfc098b674829e9f394694c3b9aeec9f239296a","observation_id":"6545c1ab-899f-40ff-971a-1f30917478df","resolution":{"observed_at":"2026-08-04T20:52:06.272252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-07T03:24:13.032388Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-04T20:52:06.279971Z","title":"Omnidrive: A holistic llm-agent framework for autonomous driving with 3d perception, reasoning and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.279971Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:28f2040794a500892beaf3c00b1f10956e7dc11f65ae3a6f5edfb932e16a5914","observation_id":"ab1bbacd-b53e-48fb-bb5b-3d99c6f92b34","resolution":{"observed_at":"2026-08-04T20:52:06.279971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.285794Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.285794Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:3013b45a2a0224b0aa2c7dbfbadfa2e89080b793b6acf37d17b6cb52ffed81a8","observation_id":"2c0a3865-ec48-4065-8669-aaee8b2ef20e","resolution":{"observed_at":"2026-08-04T20:52:06.285794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.290926Z","title":"Dol- phins: Multimodal language model for driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.290926Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ebb9e61aee6f816289af000e6893ecbbc68d3906b080c03f66ad4f9e42f23698","observation_id":"e5bb838d-6f68-4829-a109-84ab3eec627f","resolution":{"observed_at":"2026-08-04T20:52:06.290926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-04T20:52:06.295417Z","title":"Emma: End-to- end multimodal model for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.295417Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:dfe40fd3632d958a8275ff6db25b38f74126d3433386066f2dcd0e2f85178e3c","observation_id":"3598c952-d75e-4441-ae7e-319b1ece4b4f","resolution":{"observed_at":"2026-08-04T20:52:06.295417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.299745Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.299745Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0f2a707d7e81df17b8ba1b2d57b8fa2d268b91d8cf030de7b74d06c52bb47ea1","observation_id":"5e4f1d86-3b82-4191-9958-3027096e23f7","resolution":{"observed_at":"2026-08-04T20:52:06.299745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.304116Z","title":"A survey on hallucination in large language mod- els: Principles, taxonomy, challenges, and open ques- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.304116Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d92270c1b2a17e3130666cc7b22260a83956759123eb4a6be9962ecdbbf5d323","observation_id":"1c1f6882-564a-4c43-bfa7-9e01b4c0f605","resolution":{"observed_at":"2026-08-04T20:52:06.304116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.308606Z","title":"Retrieval-augmented genera- tion for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.308606Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:fdc00909bf795744f4a393b24283511292a763ac3d1594569cfdefddb1860c63","observation_id":"977244c2-3572-457e-ba6a-ed1b2b120fdc","resolution":{"observed_at":"2026-08-04T20:52:06.308606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.313814Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.313814Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:37996625a421fcbadf46fcf236c489be054c1fddc461d7f46e0984701cfab6a6","observation_id":"703757cb-f79b-48ae-a467-4b4bd68e965e","resolution":{"observed_at":"2026-08-04T20:52:06.313814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.320327Z","title":"Driving with llms: Fusing object-level vector modal- ity for explainable autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.320327Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c88a21e9b60bc54551b9883a35f2008e567f28ecb4d9b740ac6526c3d1636d34","observation_id":"73b7e1da-1908-430c-a002-6ffd354230d4","resolution":{"observed_at":"2026-08-04T20:52:06.320327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.324944Z","title":"A survey on occupancy perception for autonomous driv- ing: The information fusion perspective,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.324944Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7e53902e97c08901c4f5ae2cc02aca215374a17e09c7ac10f106b9a42aa4a771","observation_id":"001be390-273c-42c5-9086-c894ec33fd87","resolution":{"observed_at":"2026-08-04T20:52:06.324944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.331586Z","title":"Neural vol- umetric world models for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.331586Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e397da18f6ff632c5fb11acdcbf0fccb4f8a95c4ca5459930a16ffd6638c913a","observation_id":"1479719f-f425-4895-b9df-12cec0af5abb","resolution":{"observed_at":"2026-08-04T20:52:06.331586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.336689Z","title":"Tri-perspective view for vision-based 3d semantic oc- cupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.336689Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:29210ea2a431afb15da03c9f7b317ab4021934b290ab9e2734f4d7a9357357f9","observation_id":"34593224-8340-4434-88b9-dcf1ba67067f","resolution":{"observed_at":"2026-08-04T20:52:06.336689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.341604Z","title":"V oxformer: Sparse voxel transformer for camera-based 3d se- mantic scene completion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.341604Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:77b15c0a103ef6815e404ea40aeb8c0e5e8903d66b92daab2e14cb4d00c6bb5a","observation_id":"82f575c2-6de9-438b-9b6d-0f9a26cb95d1","resolution":{"observed_at":"2026-08-04T20:52:06.341604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.348253Z","title":"Occformer: Dual-path transformer for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.348253Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:67973f0b48adb54ba836e816cf3d1b6127204961d74ed62b9474efc368482ea4","observation_id":"65acb063-59a9-4f83-be6d-2983ad8596a0","resolution":{"observed_at":"2026-08-04T20:52:06.348253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.353724Z","title":"Fully sparse 3d occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.353724Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b134389891ce85715501355af5f2e774dc4dda3c640dc350905356a0f991c77e","observation_id":"30f16fba-7139-4035-b7a9-0c136bee422f","resolution":{"observed_at":"2026-08-04T20:52:06.353724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.363094Z","title":"Hybridocc: Nerf enhanced transformer-based multi- camera 3d occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.363094Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:32e7d26b83fbbf52ab0d4e7cc6f078bf279996a1dd762670b771efe6ebfa1d9f","observation_id":"9ffaaa56-33af-47de-b459-9b0f51844400","resolution":{"observed_at":"2026-08-04T20:52:06.363094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.368464Z","title":"Renderocc: Vision- centric 3d occupancy prediction with 2d rendering supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.368464Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d0cf7880f7972655ca8d7f6c3397ef55acb0b8be73fbccc943971c9917b3a0aa","observation_id":"4615e532-1b5b-4770-9edd-3de223996b30","resolution":{"observed_at":"2026-08-04T20:52:06.368464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.375736Z","title":"S-nerf++: Autonomous driving simu- lation via neural reconstruction and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.375736Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ebc008e6be9be25e687b0537fe9c485af7da84b47b198607bc25f5ab690c6af5","observation_id":"be6922b5-27bf-4b10-a3f6-a4516abf7fb0","resolution":{"observed_at":"2026-08-04T20:52:06.375736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.387522Z","title":"Selfocc: Self-supervised vision-based 3d occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.387522Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:939446ebd0c5336a6ea5c7cac6c51d22173a8a5a601b3ab012785bd2327ca81d","observation_id":"d5c805ad-40d8-4c26-9740-77783c7ae86f","resolution":{"observed_at":"2026-08-04T20:52:06.387522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11356","last_updated":"2025-02-13T05:20:48Z","snapshot_observed_at":"2026-08-10T11:06:50.221913Z","submitted_at":"2024-09-17T17:00:52Z","title":"RenderWorld: World Model with Self-Supervised 3D Label","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11356","snapshot_observed_at":"2026-08-04T20:52:06.391983Z","title":"Renderworld: World model with self-supervised 3d label,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.391983Z"},"links":{"cited_paper":"/paper/2409.11356","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b9b7f7d4a08031bec8c54f8aec8784bd697ac87b9f3bf79f03e57ebcdce7eaad","observation_id":"a473cd25-a1ab-4d80-8798-767ed4d65a06","resolution":{"observed_at":"2026-08-04T20:52:06.391983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17288","last_updated":"2025-08-25T07:44:26Z","snapshot_observed_at":"2026-08-07T17:52:50.015358Z","submitted_at":"2025-02-24T16:16:01Z","title":"GaussianFlowOcc: Sparse and Weakly Supervised Occupancy Estimation using Gaussian Splatting and Temporal Flow","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17288","snapshot_observed_at":"2026-08-04T20:52:06.396798Z","title":"Gaussian- flowocc: Sparse and weakly supervised occupancy es- timation using gaussian splatting and temporal flow,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.396798Z"},"links":{"cited_paper":"/paper/2502.17288","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f8d43a15eb8c0c432ab42eddc413cb2549d73650eb1e3b032bd0c4a90eace991","observation_id":"1d99020e-7f55-40ca-b8d5-8c61fb58add6","resolution":{"observed_at":"2026-08-04T20:52:06.396798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.404842Z","title":"Street gaussians: Modeling dynamic urban scenes with gaussian splat- ting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.404842Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:1552e94f5322366a50023e6a7ce414ca1b009ddba48877ebd47a953a8bd501c3","observation_id":"24b1a303-cb16-4c99-a1b9-33942cd6e303","resolution":{"observed_at":"2026-08-04T20:52:06.404842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.412278Z","title":"Gaussianformer: Scene as gaussians for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.412278Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c15971a99f3d85ce197fa65fcebf975b1bfed6ef1533222ca1f8cbb773dc53bc","observation_id":"d704555e-22fb-4d26-89bc-67fec162f7df","resolution":{"observed_at":"2026-08-04T20:52:06.412278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.419424Z","title":"Surroundocc: Multi-camera 3d occupancy pre- diction for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.419424Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c51512c16366d11ebad8a361e9e334c704b7324d60309a374276a476adc0ae55","observation_id":"2e9902a1-753f-4e91-9b0d-b471be8fa350","resolution":{"observed_at":"2026-08-04T20:52:06.419424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.430373Z","title":"Uno: Unsupervised occupancy fields for per- ception and forecasting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.430373Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:894c3b1ecc71e78a05d966fe1965ec1cc442cb056d160980a276f7ae3e275052","observation_id":"1c398fed-632f-4b0f-9b3b-a027bdf1a06d","resolution":{"observed_at":"2026-08-04T20:52:06.430373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.440273Z","title":"Maeli: Masked au- toencoder for large-scale lidar point clouds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.440273Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b9778f9c74cc5223803061a92c0808b39fd956652281517e18eb53ff1c8aa2e7","observation_id":"b2d0919c-459d-47d2-9266-e11f47851c21","resolution":{"observed_at":"2026-08-04T20:52:06.440273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.454199Z","title":"Masked autoencoder for self-supervised pre-training on lidar point clouds,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.454199Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:df34844336afc241a796115bc708faf7f4af787c04712b937d330799fa2718a6","observation_id":"a71e55e2-ee72-4f0e-9534-fc3aeab6833b","resolution":{"observed_at":"2026-08-04T20:52:06.454199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.461440Z","title":"Bev-mae: Bird’s eye view masked autoencoders for point cloud pre-training in autonomous driving sce- narios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.461440Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:25c3f5a988a9e4232264106a491437df8af78b0a705750296a2a2ef9fd206534","observation_id":"ad181b6e-cb92-4571-a1b0-7d6603404a52","resolution":{"observed_at":"2026-08-04T20:52:06.461440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.910341Z","title":"Geo- mae: Masked geometric target prediction for self- supervised point cloud pre-training,","venue":null,"work_id":"65bc0eac-f47e-4c80-8cae-00897b563a66","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.466253Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7e2f07f916fa9380e059ffc385ec8b32e5612c72ac9bcf9149d3f16665e5fe36","observation_id":"717ed5c5-dc35-4283-81b9-1c546ed7bbf2","resolution":{"observed_at":"2026-08-04T20:52:11.958701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.827599Z","title":"Openoccupancy: A large scale benchmark for surrounding semantic oc- cupancy perception,","venue":null,"work_id":"1e200f5e-f91d-4a2a-bf43-8c7b94ab006f","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.473340Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b672028cd408d3dd2bc5a4bd61e42d27d0fdc1c77178c5cfd9f57a35a81386ca","observation_id":"2cb009e3-6fad-4b92-af25-a0e5f5d355db","resolution":{"observed_at":"2026-08-04T20:52:11.853318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.691128Z","title":"Occ3d: A large-scale 3d occu- pancy prediction benchmark for autonomous driving,","venue":null,"work_id":"39405f54-2763-4d6e-b24d-a15134e5448d","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.479214Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:733acb61d99aec8f52a53d6a3a44c8a6433fcf9bc08c10cb05684566e62f758b","observation_id":"f6a9f70f-24ed-4655-8ec9-92d3e3846131","resolution":{"observed_at":"2026-08-04T20:52:11.741657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-04T20:52:06.484270Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.484270Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:88d56524a514ba7e12625cec71782e2de2d2e3e0a8c208ee5e52000ef675f7e5","observation_id":"f207edd4-de38-4471-a912-3265676c83f5","resolution":{"observed_at":"2026-08-04T20:52:06.484270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.577117Z","title":"Cross-modal contrastive learning for domain adap- tation in 3d semantic segmentation,","venue":null,"work_id":"667bec92-00b8-48b6-9e3c-ce96810147ae","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.490510Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:aa6e0a03f246758732fd8a20ece305b896cff772c10b29b99d0109d75e6f0edd","observation_id":"64004ea8-13af-4853-be77-bf72b6e0d902","resolution":{"observed_at":"2026-08-04T20:52:11.602627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.467968Z","title":"4d contrastive superflows are dense 3d representation learners,","venue":null,"work_id":"b47e55ba-674f-4504-9ecf-a97266a106e3","year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.499824Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ad10e4711012d2b45025ee45ff6cc7a6f5fb473f7692a68b4ce63510278078fa","observation_id":"17f96b34-aa93-4c4c-bd53-8196ce44d4eb","resolution":{"observed_at":"2026-08-04T20:52:11.493586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.364639Z","title":"Superflow++: Enhanced spatiotemporal con- sistency for cross-modal data pretraining,","venue":null,"work_id":"5ffd8ed6-7649-4b79-b217-dc7c01a0af92","year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.505917Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0f314502ae43a9e7a8bf182c1f0a58262d011c2066d004058d3fa6688f27bdc8","observation_id":"e5ae1d23-a4cc-42f0-96be-6a0d24730c45","resolution":{"observed_at":"2026-08-04T20:52:11.409874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16873","last_updated":"2025-08-19T08:07:30Z","snapshot_observed_at":"2026-07-06T18:20:22.759333Z","submitted_at":"2024-05-27T06:43:12Z","title":"ContrastAlign: Toward Robust BEV Feature Alignment via Contrastive Learning for Multi-Modal 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16873","snapshot_observed_at":"2026-08-04T20:52:06.510402Z","title":"Contrastalign: Toward robust bev feature alignment via contrastive learning for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.510402Z"},"links":{"cited_paper":"/paper/2405.16873","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:00e2f7fe339563c3dc3fe54be9f16140d284416346dd2ecb5cdbf5d0c1013733","observation_id":"e51c080a-0dbe-4bfd-a2bc-371a2c3211e6","resolution":{"observed_at":"2026-08-04T20:52:06.510402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09386","last_updated":"2022-11-17T07:26:14Z","snapshot_observed_at":"2026-08-10T09:35:55.499684Z","submitted_at":"2022-11-17T07:26:14Z","title":"BEVDistill: Cross-Modal BEV Distillation for Multi-View 3D Object Detection","version":1},"cited_work":{"arxiv_id":"2211.09386","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09386","snapshot_observed_at":"2026-08-04T20:52:07.302544Z","title":"BEVDistill: Cross-Modal BEV Distillation for Multi-View 3D Object Detection","venue":"cs.CV","work_id":"7cb12d1a-d641-4e6d-b62f-2a0cdeb611e8","year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.514900Z"},"links":{"cited_paper":"/paper/2211.09386","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:cd767c7c5f8453384003054acb1d477673fd042c26305fbf8ad029d281bd45dd","observation_id":"f7d3ad64-de83-4a49-9c0b-b076dc108545","resolution":{"observed_at":"2026-08-04T20:52:07.308999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.218838Z","title":"Distill- bev: Boosting multi-camera 3d object detection with cross-modal knowledge distillation,","venue":null,"work_id":"98248a80-458d-4eae-a978-572b1b8708db","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.519795Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:afc8ee11d53388816a4644d62fa605fa019aa0941779f9e82a0f35dacf9cd1d3","observation_id":"1fe045da-f0f8-46b0-8cf4-87fc20ed479b","resolution":{"observed_at":"2026-08-04T20:52:11.268784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03105","last_updated":"2023-04-07T16:31:07Z","snapshot_observed_at":"2026-07-06T15:12:57.672390Z","submitted_at":"2023-04-06T14:33:05Z","title":"Geometric-aware Pretraining for Vision-centric 3D Object Detection","version":2},"cited_work":{"arxiv_id":"2304.03105","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.03105","snapshot_observed_at":"2026-08-04T20:52:07.270148Z","title":"Geometric-aware Pretraining for Vision-centric 3D Object Detection","venue":"cs.CV","work_id":"16bfe2cc-e195-4d2f-99da-40da47383d26","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.524843Z"},"links":{"cited_paper":"/paper/2304.03105","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0aabd5fe303734d046eaf49a29f38b22a13502e3ed53415384a0f3b1a923d742","observation_id":"e5b5c084-ceb6-4252-9a09-6123e0307ead","resolution":{"observed_at":"2026-08-04T20:52:07.279648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.075491Z","title":"Unidis- till: A universal cross-modality knowledge distillation framework for 3d object detection in bird’s-eye view,","venue":null,"work_id":"03236b47-6042-452c-8a8e-68794d630df7","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.530339Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0d7a7d1c4021f5e9791cf39f14b2fd37f2cfdae34402923f792f05033a0ef8ee","observation_id":"6b67b156-6f08-49d4-8398-ee7bd8d43878","resolution":{"observed_at":"2026-08-04T20:52:11.129176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.939573Z","title":"Revisiting domain generalized stereo match- ing networks from a feature consistency perspec- tive,","venue":null,"work_id":"dfd8f8b0-911a-4393-986c-5b19f4b20feb","year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.535252Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4af19692c2cae4e8c9faf5a210ea137399d80733285d21574d79f1171ee5da3f","observation_id":"2c0bd976-ee51-4a9c-8764-b69dcaafee5c","resolution":{"observed_at":"2026-08-04T20:52:10.988761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.796690Z","title":"Weakly supervised monocular 3d object detection using multi-view projection and direction consis- tency,","venue":null,"work_id":"04d6fc01-7747-44ed-9b9d-dc793beb1763","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.539772Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:57fd401726ef9e8fb00052bdf24799f2a6f9a030526d370c98747d6290b7bb77","observation_id":"aa4d1f90-2d62-4d39-93f3-c3222569a5c0","resolution":{"observed_at":"2026-08-04T20:52:10.852859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.688254Z","title":"Bevformer: learning bird’s-eye- view representation from lidar-camera via spatiotem- poral transformers,","venue":null,"work_id":"51746243-10a2-4953-b055-0ba0c1019848","year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.548022Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:8d76ce20b4002769381c533de562e8faeeceb4d39508527d158b112cdc4238c5","observation_id":"60efd1e8-6ef1-4470-9b09-ffaf730b17a8","resolution":{"observed_at":"2026-08-04T20:52:10.737724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.536619Z","title":"Ega- depth: Efficient guided attention for self-supervised multi-camera depth estimation,","venue":null,"work_id":"04895f69-43b8-4f4b-855f-0b6d59d9e7b7","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.554368Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:2db85fe504fc801bfdbf7da3f6527c146e383a9efac1ed2bed9c3b8815856657","observation_id":"13f62e17-857c-4cc5-8769-e33ca9238a43","resolution":{"observed_at":"2026-08-04T20:52:10.597236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.374397Z","title":"Multimae: Multi-modal multi-task masked autoen- coders,","venue":null,"work_id":"6a0a81e2-aaec-4e7c-88d4-dd652bdfc432","year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.559453Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:cfaebb0ff73b77de2c924ba75440b31aa000eb18745d715ae3cf6fe15feedc85","observation_id":"e79ebaf7-1f1e-4b72-991a-0aa03f6a2c33","resolution":{"observed_at":"2026-08-04T20:52:10.430743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T04:09:23.152980Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":144},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 144 outbound references and 0 inbound Pith citation observations for arXiv:2509.08302."}