{"as_of":"2026-08-17T00:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14a07ab40f83e262d3d53655ee1e245e96c520a92805117f54800d9858d8b110","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:13.187292Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:08:21.388777Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T05:46:01.450385Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.06218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-07-09T05:46:01.450385Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","venue":"cs.CV","work_id":"ed88a64c-969e-4262-b09b-e20d235294e6","year":2025},"citing_paper":{"arxiv_id":"2605.27038","last_updated":"2026-05-26T13:56:31Z","snapshot_observed_at":"2026-08-16T13:12:38.040448Z","submitted_at":"2026-05-26T13:56:31Z","title":"TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T17:42:49.902997Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2605.27038"},"observation_digest":"sha256:7673e181cd4bb1e38fd0db2ff5a08d6696750e23f75fa7b5d268481e209da70b","observation_id":"57803ea2-d4b9-4db3-bc67-e67f7b813e83","resolution":{"observed_at":"2026-06-29T17:43:45.701944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.06218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-07-09T05:46:01.450385Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","venue":"cs.CV","work_id":"ed88a64c-969e-4262-b09b-e20d235294e6","year":2025},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-08-16T16:13:02.154121Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:46.145616Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:ac432b3d6b6c4f303a04812b12419817fbbde192e079448401201b3ff235d936","observation_id":"2a0ecd49-8cb3-4f76-8ee6-0f4f7b711920","resolution":{"observed_at":"2026-06-29T18:23:51.170067Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.06218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-07-09T05:46:01.450385Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","venue":"cs.CV","work_id":"ed88a64c-969e-4262-b09b-e20d235294e6","year":2025},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-08-16T16:13:02.154121Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-02T21:35:33.280591Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:e65481db986d99cf09b0d5012ac7aac7e8fed50fd03045819143d788999c622a","observation_id":"2d3d9db3-be22-4727-97a6-fc5ab8d8f675","resolution":{"observed_at":"2026-07-02T21:37:24.199322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.06218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-07-09T05:46:01.450385Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","venue":"cs.CV","work_id":"ed88a64c-969e-4262-b09b-e20d235294e6","year":2025},"citing_paper":{"arxiv_id":"2607.07601","last_updated":"2026-07-08T16:20:19Z","snapshot_observed_at":"2026-08-16T07:35:08.730306Z","submitted_at":"2026-07-08T16:20:19Z","title":"CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T05:40:54.265224Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2607.07601"},"observation_digest":"sha256:f27f6b07faa9d0d26ca695a16f5e4b82596520bf573cfa5b53af104ca53e7f1b","observation_id":"761ad56b-b155-434d-a190-58ebc25690a6","resolution":{"observed_at":"2026-07-09T05:46:01.453100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-07-30T19:51:03.570643Z","title":"Stsbench: A spatio-temporal scenario benchmark for multi-modal large language models in autonomous driving.arXiv preprint arXiv:2506.06218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23537","last_updated":"2026-07-26T08:13:46Z","snapshot_observed_at":"2026-08-09T12:07:15.696109Z","submitted_at":"2026-07-26T08:13:46Z","title":"ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T19:51:03.570643Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2607.23537"},"observation_digest":"sha256:ebda876c89ed6a6454463573b669001d953bf2af167bb5388301729fd8abaf4d","observation_id":"13b4fbaf-9454-4e66-91ec-dc9f651d025f","resolution":{"observed_at":"2026-07-30T19:51:03.570643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-08-06T00:08:21.388777Z","title":"Stsbench: A spatio-temporal scenario benchmark for multi-modal large language models in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-15T17:17:10.459249Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.388777Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:0d8541e9b75eb27d7ba60af86a867892d715b3d75708bfb116cb78ebf36b8120","observation_id":"9b79c5e9-0f91-48c2-a21f-3c066ff5d836","resolution":{"observed_at":"2026-08-06T00:08:21.388777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06218/citation-record","integrity":"/paper/2506.06218/integrity","json":"/paper/2506.06218/citation-record.json","paper":"/paper/2506.06218"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.319807Z","title":"LLaMA 3.2: Open Foundation and Instruction Models, 2024","venue":null,"work_id":"b31ee88d-6ff4-4f76-8090-c50ecaf952b5","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.796168Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:1b3985f5606dd521204499b7a6eb2cf6918dee65c5454f14135ec1de10d9e1ac","observation_id":"578c97c1-444d-4a6e-b1e1-13d8c2717b6f","resolution":{"observed_at":"2026-08-07T06:02:14.323684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.306772Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":"32cdd405-807d-44a6-89fd-84f6bac8e1bb","year":2022},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.800668Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:24203e3587006129ed7453a3c14198f5ce81758cacc16701d01cc2549128f3b2","observation_id":"63cdeb96-d1e5-4291-a68f-ce8c9d47efe4","resolution":{"observed_at":"2026-08-07T06:02:14.311045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.294379Z","title":"CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving","venue":null,"work_id":"65d49fda-f8d5-44e1-8640-f1e7ae4c79bd","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.805120Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:88677a24efa9ae81ba98e7445dfbc6ed7c5b97c08f33001c845a55475e7fbf11","observation_id":"905ea11b-5021-431c-8a9d-558743278fe3","resolution":{"observed_at":"2026-08-07T06:02:14.298239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T06:02:12.813523Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.813523Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:54a14fe2c7f684786b09d657b284a0de1ef5ce93d2e851820a852836bdea28eb","observation_id":"13c45644-8a12-4bbd-a3a6-e11adc0b4cb0","resolution":{"observed_at":"2026-08-07T06:02:12.813523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.281731Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"dc6ebe0a-e977-4518-b652-69c7c352fa81","year":2020},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.817562Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:927fbf80c37ca2d14b52965c4c09e6c5e324cfb75aad1bc11fd8e4cc076fc396","observation_id":"7392d7c1-043c-49b9-bff4-33f1a3996cf2","resolution":{"observed_at":"2026-08-07T06:02:14.285747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.268829Z","title":"MAPLM: A Real-World Large-Scale Vision-Language Dataset for Map and Traffic Scene Understanding","venue":null,"work_id":"685e4e14-d96c-454c-ab57-1a9119edd103","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.821890Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:3355596e4edf13893b29761388a573430fe0144335687611356ab8f444f152cb","observation_id":"eaa9f319-698d-4da0-b5ab-8f591cb92aa1","resolution":{"observed_at":"2026-08-07T06:02:14.272732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:12.825529Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.825529Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:a46119446aa99d488656909bea39ae7a5f909324aa7ce54d27c880cbcf981aba","observation_id":"29e0b0a2-5b83-403e-8b58-c4e0f603a994","resolution":{"observed_at":"2026-08-07T06:02:12.825529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:12.829100Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.829100Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:c5927d14e89f6a4db63041905530f8273e6becef26171c0a16458f5c4c0d7848","observation_id":"be51db96-d4d2-40ce-b9b5-0fbd258ccd95","resolution":{"observed_at":"2026-08-07T06:02:12.829100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.238801Z","title":"The Cityscapes Dataset for Semantic Urban Scene Understanding","venue":null,"work_id":"153e3ad7-1e28-4d49-a831-bb6cbc9ffd60","year":2016},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.832601Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:957cb0aee01bbca568475d8192f5475f4bca732f575506ce759e489407543277","observation_id":"75893966-066d-4887-8676-651159a8b5fd","resolution":{"observed_at":"2026-08-07T06:02:14.242535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.226540Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":null,"work_id":"947c0c89-0c37-4f27-86ba-8c55e15c1ef3","year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.836540Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:80037fad617f31bfaf2acb2937aa0eda4d350abadffd273d881a466a1ceb20a5","observation_id":"efd415f6-72e2-431c-b563-cf6736bd4c49","resolution":{"observed_at":"2026-08-07T06:02:14.230572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T06:02:12.840182Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.840182Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:99fc2fdfa6758788a0c04e20ead96a864ca1fd2a6af551181c0c8210eca77610","observation_id":"2dc79cff-9d03-4d53-809d-9ff63e8df15b","resolution":{"observed_at":"2026-08-07T06:02:12.840182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.214131Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":"54f2fb84-4a3d-4299-bf91-75776ef8e915","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.844016Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:ba38fda98a8fb87140b8c231949db6f4e163b678687acd68030a5e0526ba0509","observation_id":"f4de31c4-3919-481f-a0d0-74aaf4f3a52f","resolution":{"observed_at":"2026-08-07T06:02:14.218383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.202394Z","title":"Talk2Car: Taking control of your self-driving car","venue":null,"work_id":"ad3a114e-ed88-4aae-8203-ed710e0b7017","year":2019},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.847511Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:9bd175aa329de298b12de6769312dde99261414bbdfce03bca4a853c4012bf8c","observation_id":"6def661e-8df5-4e99-bb0b-ff7a47980a23","resolution":{"observed_at":"2026-08-07T06:02:14.206159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T06:02:12.850966Z","title":"HiLM-D: Towards High- Resolution Understanding in Multimodal Large Language Models for Autonomous Driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.850966Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:792464c5c5dab7d0715599875dc52842c1efb5093de2917be9f39d8b7ad55325","observation_id":"88631727-4d17-4ebb-aa1a-f5478a3cf72f","resolution":{"observed_at":"2026-08-07T06:02:12.850966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.190335Z","title":"Holistic Autonomous Driving Understanding by Bird’s-Eye-View Injected Multi-Modal Large Models","venue":null,"work_id":"71a808ad-1b7b-49f0-b47a-f532ecc8f5f7","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.854590Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:75b20a887541a8cb676caaddf298217ac8beb94c35cbf2953a967664ada57cd2","observation_id":"e4a84a4e-1f60-4d2c-b8b8-495c0e52d839","resolution":{"observed_at":"2026-08-07T06:02:14.194298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.178052Z","title":"CARLA: An Open Urban Driving Simulator","venue":null,"work_id":"187a1a69-26f9-4658-8db2-1274bde0c5a9","year":2017},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.858238Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:51a4a91b2015d58ec05f997dd57d08ca18ffdf0b7fa8d93c0d12722711355067","observation_id":"601b8b08-f511-4c9f-98aa-b2353f4078fd","resolution":{"observed_at":"2026-08-07T06:02:14.181740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-15T20:54:24.552667Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19755","snapshot_observed_at":"2026-08-07T06:02:12.861632Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.861632Z"},"links":{"cited_paper":"/paper/2503.19755","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:d0aadb0b0bbacf27705a242cf71236062c19f0543501e12213c970570148343b","observation_id":"d40f0edc-972c-4867-aa84-a7a60001d6e0","resolution":{"observed_at":"2026-08-07T06:02:12.861632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.165402Z","title":"Are we ready for autonomous driving? The KITTI vision benchmark suite","venue":null,"work_id":"72676922-ee60-4408-a3c7-2d01d5095e5b","year":2012},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.974684Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:bfcd6c51c3105d029519064da7a5115318d0f340dc50e404eab17ade41ca8e4e","observation_id":"ab061dd3-fe7b-4ad6-adcb-b025364a38fe","resolution":{"observed_at":"2026-08-07T06:02:14.169479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13112","last_updated":"2025-05-27T14:49:49Z","snapshot_observed_at":"2026-08-12T16:47:22.702728Z","submitted_at":"2024-11-20T08:14:01Z","title":"SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13112","snapshot_observed_at":"2026-08-07T06:02:12.978819Z","title":"DriveMLLM: A Benchmark for Spatial Understanding with Multimodal Large Language Models in Autonomous Driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.978819Z"},"links":{"cited_paper":"/paper/2411.13112","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:4efee495b495632c2dfd853510bf5a049ff681cc2a324318b4e360e8562952cd","observation_id":"eebbe239-95f0-44ab-85c8-545ce79f0b2b","resolution":{"observed_at":"2026-08-07T06:02:12.978819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.152829Z","title":"Planning-oriented Autonomous Driving","venue":null,"work_id":"1bd2c068-065e-4534-b262-075e2e46bc98","year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.982852Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:d6441ffe394d838638ac98efb23961f5189af23aac70a734e9a57d06cf2f5bc7","observation_id":"9e87d558-b20f-4cef-ac97-7223b62a16b7","resolution":{"observed_at":"2026-08-07T06:02:14.156715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07689","last_updated":"2025-08-07T06:38:32Z","snapshot_observed_at":"2026-08-16T17:25:06.693116Z","submitted_at":"2024-12-10T17:27:32Z","title":"RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07689","snapshot_observed_at":"2026-08-07T06:02:12.986482Z","title":"Drivemm: All-in-one large multimodal model for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.986482Z"},"links":{"cited_paper":"/paper/2412.07689","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:7cf67636cb82dd7da6752152ea70b31c12da12bced26947d536017d4dd5163b9","observation_id":"83e38495-3cfb-4db7-937a-892a4f4ae3f1","resolution":{"observed_at":"2026-08-07T06:02:12.986482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.140133Z","title":"Making Large Language Models Better Planners with Reasoning-Decision Alignment","venue":null,"work_id":"3968ae76-0f5a-4e82-9efc-7404308e95eb","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.990385Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:3e85834a6dc8ea091af9066badefbd7b759a8c7844f39fd16a19b9c16fff7c0b","observation_id":"d24a4d13-87c9-47ef-b6dd-2082928fa097","resolution":{"observed_at":"2026-08-07T06:02:14.144030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-16T10:28:44.439043Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-07T06:02:12.993977Z","title":"Emma: End-to-end multimodal model for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.993977Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:fbc716d3d1b437cd6bbbf40997e1152846cffec50ec4473826d280acc67cbdb5","observation_id":"cefcec4e-63ab-43cc-9f01-be84f09718ae","resolution":{"observed_at":"2026-08-07T06:02:12.993977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.126437Z","title":"NuScenes-MQA: Integrated Evaluation of Captions and QA for Autonomous Driving Datasets Using Markup Annotations","venue":null,"work_id":"f3ec75fe-b0e0-47c4-983a-4e757416af45","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:12.998184Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:dc35e5d442d94a04f185b7653ee223ac0a7740c8b6abea632c6853c5eeff6b9e","observation_id":"4dd1bbdd-79ef-4d20-a514-4a992137034b","resolution":{"observed_at":"2026-08-07T06:02:14.130940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10621","last_updated":"2025-03-13T17:59:01Z","snapshot_observed_at":"2026-08-16T12:50:16.725971Z","submitted_at":"2025-03-13T17:59:01Z","title":"DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10621","snapshot_observed_at":"2026-08-07T06:02:13.001866Z","title":"Drivelmm-o1: A step-by-step reasoning dataset and large multimodal model for driving scenario understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.001866Z"},"links":{"cited_paper":"/paper/2503.10621","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:15b390e23f104523bd70fbe9f8e13fb11b6769cc3a7b710137fff758b0c56045","observation_id":"5fd9b368-d0d3-4e47-881c-78b07fcce794","resolution":{"observed_at":"2026-08-07T06:02:13.001866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.112926Z","title":"Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving","venue":null,"work_id":"7acc9fe4-d74f-4b08-aa62-ceee46e7338a","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.005973Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:7febf16e09598e8556d0c84476814eca469b50732790ed56c0e9d7eb72a81d57","observation_id":"ddd1bf57-9e7b-4b46-8e0f-8c99f47b4e06","resolution":{"observed_at":"2026-08-07T06:02:14.117108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.100202Z","title":"V AD: Vectorized Scene Representation for Efficient Autonomous Driving","venue":null,"work_id":"f2d5fdd8-ab7c-4cf6-bc38-1124a2f996d1","year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.009414Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:fad9c075a1768820a2305e04f63992f9ce53428e47c5da88bdb9e0bb61bb074a","observation_id":"ed812cee-cb1b-45e8-aa2c-1fff4ba8c535","resolution":{"observed_at":"2026-08-07T06:02:14.104167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-07T06:02:13.012947Z","title":"Senna: Bridging Large Vision-Language Models and End-to- End Autonomous Driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.012947Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:cdac1e3a644a698ca0fa658702f03cc8ef60daee4e2e8495d3c3db771931cdc3","observation_id":"41261a53-7866-4512-91a1-9a6668329127","resolution":{"observed_at":"2026-08-07T06:02:13.012947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.087706Z","title":"TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes","venue":null,"work_id":"3e9f590e-bef5-4a62-9612-423b1eb9d7c1","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.017175Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:fa80ab760be191a82413aef608b5e5eda07e448485fe3aaf1184985eb875dd9c","observation_id":"94ebaa67-f270-4961-aa0e-bd90ebb95002","resolution":{"observed_at":"2026-08-07T06:02:14.091617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.074778Z","title":"Textual Explana- tions for Self-Driving Vehicles","venue":null,"work_id":"29c97dd5-0017-41be-9dd2-b596584d9727","year":2018},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.020700Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:559dbbc320f1e7512ffe4c749f7ca5dbf5b3e70d4d6d250d20100faa88804218","observation_id":"19f1f03c-586a-497f-a89a-7ac07cf885c6","resolution":{"observed_at":"2026-08-07T06:02:14.078929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.062462Z","title":null,"venue":null,"work_id":"d8b437a0-0f0f-4157-b0dd-fe8146fcb4a0","year":2022},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.024159Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:292352e5fd4b8b1f560fbf5bc1da4a7af2ce575bab66e5ac87e66bf28cf13f3e","observation_id":"3551ae27-52c8-49a8-a625-373da8b077b1","resolution":{"observed_at":"2026-08-07T06:02:14.066062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.027750Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.027750Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:955e53321ae35ec31e6d6dec7512c81cbda23e6fea818ee6dc94d15ada796b1a","observation_id":"dbaa139d-cb07-4b0c-b657-91268b39a258","resolution":{"observed_at":"2026-08-07T06:02:13.027750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08861","last_updated":"2025-01-15T15:20:46Z","snapshot_observed_at":"2026-08-13T14:16:32.035959Z","submitted_at":"2025-01-15T15:20:46Z","title":"Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2501.08861","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.08861","snapshot_observed_at":"2026-08-07T06:02:13.509760Z","title":"Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving","venue":"cs.CV","work_id":"34a936a1-2149-418d-b4c4-e0095ddbe866","year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.031254Z"},"links":{"cited_paper":"/paper/2501.08861","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:ce9ee21b4438c05231b532d58df9f55675dec4cb01d6044d930a4f2be959b613","observation_id":"8b01edf7-5b07-49ad-a107-6d521729b595","resolution":{"observed_at":"2026-08-07T06:02:13.516006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.040318Z","title":"Automated Evaluation of Large Vision-Language Models on Self-driving Corner Cases","venue":null,"work_id":"2f0edcce-9981-4b52-9935-5e21a3755652","year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.035268Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:d68f9cd8292ac7daa6ebb0c6c97a0590cc80aa0b196d634b0c26737e2e1525a6","observation_id":"132f6d3e-81e1-402f-a17b-9bad4f2ea6cb","resolution":{"observed_at":"2026-08-07T06:02:14.044325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.027395Z","title":"BEVFormer: Learning Bird’s-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","venue":null,"work_id":"6b09fa61-a4a1-46b5-a153-e215a3a646ac","year":2022},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.038932Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:cc64018cbbf1121644f13b306ae948cd9c69d4f8726e696370e170b25f75aeb5","observation_id":"2700579a-bb60-4ee0-9928-9f50f1406279","resolution":{"observed_at":"2026-08-07T06:02:14.031477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:14.014747Z","title":null,"venue":null,"work_id":"2f805aae-9fb1-47e3-a8f2-9290f9277094","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.042382Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:d6d1505a32b60a64230082deb4ed5e520487ec3f8361370bea2fbe0dfd6e3ba7","observation_id":"240f776d-cfbb-458d-bf3c-6dbcf0b47e46","resolution":{"observed_at":"2026-08-07T06:02:14.018771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.045969Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.045969Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:85da62503edf6c41ab8f222634a52e35b237d5aba6d7e7a547f065b128290d1b","observation_id":"002482ce-25a7-45be-8c9b-1c2510cab280","resolution":{"observed_at":"2026-08-07T06:02:13.045969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.049457Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.049457Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:846b4ced96544c71f830755176d305bb2348879d298c91411b95b699ac387ea7","observation_id":"318f772c-2a14-4b7e-b0b1-3ab52449499d","resolution":{"observed_at":"2026-08-07T06:02:13.049457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.052905Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.052905Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:563a371be98ec4f90f1c7a5049e6614bd0dfd3c6eea52713c075a3635883dffd","observation_id":"bbd26351-f20e-4f2c-a10b-ca53f9602d7b","resolution":{"observed_at":"2026-08-07T06:02:13.052905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.976043Z","title":"Dolphins: Multimodal Language Model for Driving","venue":null,"work_id":"133c3162-f223-4d0d-8e5f-fe7065a9b1c8","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.056348Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:e6ef66b8947155a7886a2ba664fce5c17a849372f90acae9b2e19e0aa178dd59","observation_id":"71a49614-32f8-45c9-8c13-79e52a879db5","resolution":{"observed_at":"2026-08-07T06:02:13.979738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.962707Z","title":"DRAMA: Joint Risk Localization and Captioning in Driving","venue":null,"work_id":"a14349f2-b416-4988-b87c-d112ba5257f4","year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.060019Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:14707d654e2c764323d9fa0a30b042a82afd2438de5d1e0fe10086b55c29c3ea","observation_id":"013047aa-4b10-48d5-8b9b-9d903c2d2029","resolution":{"observed_at":"2026-08-07T06:02:13.967085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.948126Z","title":"One Million Scenes for Autonomous Driving: ONCE Dataset","venue":null,"work_id":"22e1a639-1094-4361-a861-576f70af68f4","year":2021},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.063837Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:e4c64e6eb8c1e717a5b3c89bf9def0517ed743e88bbf21c822d1bc8346a65d8e","observation_id":"41a19cf7-1158-4448-a836-ef7911dd0dc7","resolution":{"observed_at":"2026-08-07T06:02:13.952444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.935082Z","title":"LingoQA: Video Question Answering for Autonomous Driving","venue":null,"work_id":"f6f01301-1d4b-4b52-a28f-3509a16e8577","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.067430Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:25a7200da477bdd89e42fe887ce34ed738d748cc4a4bfca1f16582d7148aaa21","observation_id":"780325de-d703-4d4a-a403-3389f88e7dae","resolution":{"observed_at":"2026-08-07T06:02:13.939101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.922129Z","title":"Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving","venue":null,"work_id":"0155f5b1-bd5a-4faa-9a7d-70e3a169e985","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.071430Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:3e90524e6e1119d26295de58e3eb0fd5f79e4dd3da12ccbf4ee93c1893e1ef4b","observation_id":"cb004d6a-7285-419a-972f-081708cce445","resolution":{"observed_at":"2026-08-07T06:02:13.926264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T06:02:13.074966Z","title":"GPT-4 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.074966Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:62ef20ef609ec61b72b345181b71331672ee4d6ae5454618f17c16ac5d2fe426","observation_id":"cf4f7d79-26b2-4640-b2c3-9b424c0eaba3","resolution":{"observed_at":"2026-08-07T06:02:13.074966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.908628Z","title":"VLP: Vision Language Planning for Autonomous Driving","venue":null,"work_id":"8713fe83-0860-419b-adfc-d76149221aad","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.078694Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:efb5d6ad44ab35e7642a65eae1a69fbfe527da332895e3b18f8a996ccc5b40fe","observation_id":"134754d4-a4e7-447c-809d-0dce2daf5388","resolution":{"observed_at":"2026-08-07T06:02:13.912933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.895351Z","title":"NuScenes-QA: A Multi-Modal Visual Question Answering Benchmark for Autonomous Driving Scenario","venue":null,"work_id":"e6397e08-0cda-4233-bd7b-209dbafe6504","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.082205Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:9502265abfbad5a5414930f88951f2f06d9a2c1e4dbcc6b9ddb4baf074c25a54","observation_id":"bcc8709b-3780-4a6a-af70-212dca4e3f26","resolution":{"observed_at":"2026-08-07T06:02:13.899507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.086057Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.086057Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:cc70c83e0bbbbcf79318b86f3bebe92d7f9dec299f45cd21e95de36a681d5e1c","observation_id":"97156a9e-4eca-40cb-9148-7172c33361f5","resolution":{"observed_at":"2026-08-07T06:02:13.086057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.873922Z","title":"Rerun: A Visualization SDK for Multimodal Data, 2024","venue":null,"work_id":"d22f53ea-735e-43d4-a80f-557499537f08","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.089541Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:65d608c6ed9ff09d47d5b42c9663a899f078a2e2076d48e7a0266a3039919f80","observation_id":"9763a031-1998-44a4-86f8-1f149144cc7b","resolution":{"observed_at":"2026-08-07T06:02:13.877564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.861700Z","title":"Rank2Tell: A Multimodal Driving Dataset for Joint Importance Ranking and Reasoning","venue":null,"work_id":"0e573138-251c-4069-afc0-1fb870f43e78","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.093398Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:0bbad53c863efc1624fe2511f8fc3414d4baf1a597681ccb843945051834e059","observation_id":"134d81e8-f02b-46f6-9c80-612713c386b6","resolution":{"observed_at":"2026-08-07T06:02:13.865560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.848148Z","title":"Waslander, Yu Liu, and Hong- sheng Li","venue":null,"work_id":"b142b28f-5743-4185-855d-7bb6ef3beaac","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.097032Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:366f7eebe411d761851bdab1ad9208bfabb9e6ec418317dee7e1603a7d8d7b1b","observation_id":"1593a902-c933-491f-b71a-d6ebb71ea76f","resolution":{"observed_at":"2026-08-07T06:02:13.852220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.835118Z","title":"DriveLM: Driving with Graph Visual Question Answering","venue":null,"work_id":"29d2e43c-8eea-4e60-b0db-98db7de28c69","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.100678Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:0cbceffddefe073fb376e62bb1bda20e7934b7c4854cfc7c4fc9d50806a75301","observation_id":"87b7c163-2644-4d34-b0d8-dffa49d438b4","resolution":{"observed_at":"2026-08-07T06:02:13.838832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.104094Z","title":"InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.104094Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:91e1889d37c1fa80befe76929bda1c89ccdd1ad5dd1b287b83dc149a193b57e2","observation_id":"41fddff6-2566-4c61-a976-f856dc4612b2","resolution":{"observed_at":"2026-08-07T06:02:13.104094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.822410Z","title":"Scalability in Perception for Autonomous Driving: Waymo Open Dataset","venue":null,"work_id":"92df4987-73bd-463c-b0ac-121b9ef4b05c","year":2020},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.107627Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:e6f3f42349fdbe84f4dc474456e142b86a102a5757ba1275af2a3d4171a3c4a6","observation_id":"7b77396c-1291-433d-82d4-6ebf7af29670","resolution":{"observed_at":"2026-08-07T06:02:13.826552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03164","last_updated":"2025-04-07T03:39:02Z","snapshot_observed_at":"2026-08-16T12:44:04.450879Z","submitted_at":"2025-04-04T04:43:10Z","title":"NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03164","snapshot_observed_at":"2026-08-07T06:02:13.111100Z","title":"NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.111100Z"},"links":{"cited_paper":"/paper/2504.03164","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:64d95a0852bb3b94356fb589650e8cde9f6414f9b21b8e880b61521ab729cc04","observation_id":"bb8925f4-fb50-4f58-8bc6-6e3acc12d6ab","resolution":{"observed_at":"2026-08-07T06:02:13.111100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.810284Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","venue":null,"work_id":"f39b0076-0261-4f32-9d3c-cf70b01b7cfe","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.114668Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:612f6be351b4fe59575b05712ae092f1c33601ad15f93753e45a165bf6d70208","observation_id":"f1ce3a9e-3718-4ac9-a315-490601e658e7","resolution":{"observed_at":"2026-08-07T06:02:13.814190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.798247Z","title":"Object Referring in Videos With Language and Human Gaze","venue":null,"work_id":"263623ec-dd6c-4dce-b419-c6090f5854b3","year":2018},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.118138Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:72e1c49bf5a7f059f2779331ff9f96f4634225607689e22cf5fde132aba28f8b","observation_id":"860292ef-8592-4576-9437-ee71171cbe26","resolution":{"observed_at":"2026-08-07T06:02:13.801960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.785445Z","title":"Exploring Object- Centric Temporal Modeling for Efficient Multi-View 3D Object Detection","venue":null,"work_id":"b3bfad01-6d96-4434-b811-77e477cf9993","year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.121934Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:995f2354bcbbc6e19ed9510ba788aaa9467089640959adc9cd4ff041ab10fffa","observation_id":"33cdbd46-4a8c-4df3-959f-0e485c860f1c","resolution":{"observed_at":"2026-08-07T06:02:13.789264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-16T13:55:51.469720Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-07T06:02:13.125473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.125473Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:f799b54f3dd83155d65edb67794b0c760812f0c8f13f8fcc2ac5fce216dd6f34","observation_id":"f89684e8-d231-42ff-8cd8-d8119f7c033c","resolution":{"observed_at":"2026-08-07T06:02:13.125473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.129189Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.129189Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:c3f17f119eea208883c7e8c8ef3bd8dfb2eedcf9a8c39ac94b9aa117ba18b2cc","observation_id":"cb4cbe43-40cb-4e80-8d76-ddc71f041efa","resolution":{"observed_at":"2026-08-07T06:02:13.129189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.764511Z","title":"Argoverse 2: Next Generation Datasets for Self-driving Perception and Forecasting","venue":null,"work_id":"e44ec444-1929-484e-a474-55763bb37420","year":2021},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.132528Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:01735bba051d8fd60c8525538a73f8b7e233f881c1996de0b467aec9730e1c66","observation_id":"d88d3f1b-67ba-4b72-8aba-72c12dd19460","resolution":{"observed_at":"2026-08-07T06:02:13.768279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03074","last_updated":"2025-03-05T00:27:32Z","snapshot_observed_at":"2026-08-16T12:53:02.267610Z","submitted_at":"2025-03-05T00:27:32Z","title":"BEVDriver: Leveraging BEV Maps in LLMs for Robust Closed-Loop Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03074","snapshot_observed_at":"2026-08-07T06:02:13.136091Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.136091Z"},"links":{"cited_paper":"/paper/2503.03074","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:3af60236a94a5acef341518fd0c101dd022119c27119a777ec5b47fb673fa977","observation_id":"dfaf150f-7bbd-48cc-a930-5b5a60c4a71a","resolution":{"observed_at":"2026-08-07T06:02:13.136091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.752435Z","title":"Language Prompt for Autonomous Driving","venue":null,"work_id":"95abae1f-8ff1-4ec3-bc76-a13f83fbf1d0","year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.139784Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:063cb60614a82060064288fbe2cc163ea72ce9536a3c578ef26342f9e9483303","observation_id":"ad5f8d31-1693-43e6-83ed-ccb971147ec1","resolution":{"observed_at":"2026-08-07T06:02:13.756163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-14T06:26:44.353267Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04003","snapshot_observed_at":"2026-08-07T06:02:13.143198Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.143198Z"},"links":{"cited_paper":"/paper/2501.04003","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:64a128c8f1099fda1cd2ce5c27e3bb595b4ee3bfb4ad52373eda6db81e277462","observation_id":"d4d6aed3-8deb-41f1-8318-014e26189f73","resolution":{"observed_at":"2026-08-07T06:02:13.143198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.740525Z","title":"Explainable Object-Induced Action Decision for Autonomous Vehicles","venue":null,"work_id":"1c60275b-8b1c-4ce1-ab69-a79fc730f57d","year":2020},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.146937Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:f4cb9340cad30f4c78f147c6866f96c12064ddafc12b9c07c07b4d0a1002753e","observation_id":"07fa72f2-17f2-4265-9bb6-c46b7207bb8c","resolution":{"observed_at":"2026-08-07T06:02:13.744300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.727786Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model","venue":null,"work_id":"09c2f1cf-6652-4a8c-ba9c-1b04fb9ad241","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.150620Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:d7633babd1f398733ca9a4c3ada74e00b65ac2790c782c0bfa368135146943d2","observation_id":"e032a932-7c28-4897-8aa4-fbd41d5d5bad","resolution":{"observed_at":"2026-08-07T06:02:13.732394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.715557Z","title":"BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learning","venue":null,"work_id":"94173483-8fcb-4623-a856-22d01dd9d561","year":2020},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.154080Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:6b7cad135450f37aba908b054a24bcff7526aa57f4a427ec0748ce5a39451115","observation_id":"223ca51b-e1e8-43c3-b3d9-18af9342e671","resolution":{"observed_at":"2026-08-07T06:02:13.719320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14526","last_updated":"2025-04-20T07:50:44Z","snapshot_observed_at":"2026-08-16T11:44:34.383195Z","submitted_at":"2025-04-20T07:50:44Z","title":"Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14526","snapshot_observed_at":"2026-08-07T06:02:13.157665Z","title":"Are Vision LLMs Road- Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.157665Z"},"links":{"cited_paper":"/paper/2504.14526","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:bcc4a2fe8f46cd42c934e96a318b8fff7a2ac4ef0a6bc73e0559b449b0d3f38b","observation_id":"292ac349-af25-448f-a8da-beacad958f26","resolution":{"observed_at":"2026-08-07T06:02:13.157665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.702413Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":null,"work_id":"abf4553a-20b7-4d84-a112-ed804306ca87","year":2023},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.161399Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:9980bbb5351ccb9f3c65250354a0f091ea8b5e0ddaaee24eb55ddd2dbef55dbb","observation_id":"c7220aac-9563-4639-9e3e-d34b828a3844","resolution":{"observed_at":"2026-08-07T06:02:13.706389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.689275Z","title":"Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning, 2025","venue":null,"work_id":"7bcdc90f-b1b5-4372-b4c4-0f3e17795f32","year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.165120Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:70db7734f208788a52cbf84883f9b6af37fd929ec24dafd4397ed8fab6fbbaab","observation_id":"dc59d335-10d2-41a7-887b-feecbf0eedf1","resolution":{"observed_at":"2026-08-07T06:02:13.693280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.677031Z","title":"Large Language Models Are Not Robust Multiple Choice Selectors","venue":null,"work_id":"7d793a56-b48e-4dd2-be0d-4b60e42d308a","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.168578Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:0e66ab839d9576f2fb2aa0ddbdfe7c12ca8d4b8650ba6741d9f997ea818ad60d","observation_id":"dd65be83-e74e-4cc0-a07d-55f577fadc0f","resolution":{"observed_at":"2026-08-07T06:02:13.680927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09627","last_updated":"2024-12-12T18:59:59Z","snapshot_observed_at":"2026-08-14T07:24:23.254068Z","submitted_at":"2024-12-12T18:59:59Z","title":"Doe-1: Closed-Loop Autonomous Driving with Large World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09627","snapshot_observed_at":"2026-08-07T06:02:13.171979Z","title":"Doe-1: Closed-Loop Autonomous Driving with Large World Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.171979Z"},"links":{"cited_paper":"/paper/2412.09627","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:33aaf9fbb3621f62638148cceee42c77754a57a0862f322192dd674421f77795","observation_id":"0c025d56-caaf-488c-8a4b-a9c382724fa6","resolution":{"observed_at":"2026-08-07T06:02:13.171979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14729","last_updated":"2025-08-13T09:10:30Z","snapshot_observed_at":"2026-08-14T07:25:05.025870Z","submitted_at":"2025-01-24T18:59:51Z","title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14729","snapshot_observed_at":"2026-08-07T06:02:13.175610Z","title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.175610Z"},"links":{"cited_paper":"/paper/2501.14729","citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:5c90c9ccf209e38031600b4741ecbb660fa7895edfd9cb9d21dc18df0d376767","observation_id":"213a1e93-b9ef-4b95-b707-d07d4e80dfbd","resolution":{"observed_at":"2026-08-07T06:02:13.175610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.179479Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.179479Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:b0ebb997d82660f692a85fccbf2b173fcc36549546a1515ab7d6996ddb93f0ae","observation_id":"eafc358d-10b8-4a46-b629-3beb1bc903f1","resolution":{"observed_at":"2026-08-07T06:02:13.179479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.664369Z","title":"Embodied Understanding of Driving Scenarios","venue":null,"work_id":"59d82223-c819-4a08-9771-597c38f9f31a","year":2024},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.182943Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:fab110828f6fd99c5b86af2f17e4f1ad0c3c889c01c9e1383804f0414ed35d26","observation_id":"05f11f15-3548-4c0d-9279-c56be095989d","resolution":{"observed_at":"2026-08-07T06:02:13.668516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:13.651780Z","title":"Ego turning left,","venue":null,"work_id":"0eb78079-a92e-49e7-8512-ed16a2295946","year":null},"citing_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:13.187292Z"},"links":{"citing_paper":"/paper/2506.06218"},"observation_digest":"sha256:3eabe3f5b3c5d81aa52efa3a848d15980797cc36efa9b298cf269864a431be74","observation_id":"c267b539-9536-4bf2-8eaa-69e75c2ce4c1","resolution":{"observed_at":"2026-08-07T06:02:13.655652Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":45},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 6 inbound Pith citation observations for arXiv:2506.06218."}