{"as_of":"2026-08-19T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d852f3802991c59e43549fbe3a195c2e9f5ccbfd90613f4a1b4fae72c934febc","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:04:12.534638Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:53:09.960199Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T21:53:10.262664Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"cited_work":{"arxiv_id":"2411.12980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.12980","snapshot_observed_at":"2026-08-15T21:53:10.262664Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","venue":"cs.CV","work_id":"10c95721-fb43-4721-946d-5964ac57a0b8","year":2024},"citing_paper":{"arxiv_id":"2505.08725","last_updated":"2025-05-13T16:36:51Z","snapshot_observed_at":"2026-08-18T21:25:54.612280Z","submitted_at":"2025-05-13T16:36:51Z","title":"Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:53:09.960199Z"},"links":{"cited_paper":"/paper/2411.12980","citing_paper":"/paper/2505.08725"},"observation_digest":"sha256:97d7dec22769b50cff2a556497096c109a55ccb0f6a642b93c99071b2f33bc59","observation_id":"70d8969c-ee11-425b-a5c5-65bb897228a4","resolution":{"observed_at":"2026-08-15T21:53:10.269257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.12980/citation-record","integrity":"/paper/2411.12980/integrity","json":"/paper/2411.12980/citation-record.json","paper":"/paper/2411.12980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.995993Z","title":"Meteor: An auto- matic metric for mt evaluation with improved correla- tion with human judgments","venue":null,"work_id":"1dbe811e-59e5-457d-8995-0aa2b952846e","year":2005},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.403437Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:c1082e62f0558713f0c44086bfaf7bd4b0795d43717208fc2230850b5a9708a1","observation_id":"86041218-8aff-4b6b-84bc-689843ff16d2","resolution":{"observed_at":"2026-08-12T17:04:13.000461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.981962Z","title":"Is space-time attention all you need for video under- standing? In Proceedings of the International Confer- ence on Machine Learning (ICML) , 2021","venue":null,"work_id":"4b118cce-83b4-46fd-af81-8ec020374bbb","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.408133Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:4cbc34e9747b5dd37d10ef5538bd8a5734cec19b3ab2aaa588ecd5687620657f","observation_id":"f011736c-f8a9-4ef8-a26c-fe26925ceb21","resolution":{"observed_at":"2026-08-12T17:04:12.986694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.968253Z","title":"Driving with llms: Fusing object-level vector modality for explainable au- tonomous driving","venue":null,"work_id":"06af6c96-fbfe-4713-8e68-76f5da111afe","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.413197Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:54f22ef66d2ed52942ca9be0dc289becdc346eb8bb0d3e1a67dd86e38ff6ff69","observation_id":"f84fc7a9-acd8-41d7-8f0b-201a3dc32b79","resolution":{"observed_at":"2026-08-12T17:04:12.972759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.954415Z","title":null,"venue":null,"work_id":"a975f031-fb86-4455-9d4f-78c4727371b8","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.418422Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:196cb27e89108f4892efd036e9a7006c3c1848ca2f806c46e4555dd15534c793","observation_id":"6aafe554-1c1a-4b4f-abac-76eda3a1acb6","resolution":{"observed_at":"2026-08-12T17:04:12.959236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.939698Z","title":null,"venue":null,"work_id":"3ec12a4a-7710-4245-9d63-f8f7d5213ac0","year":2022},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.423188Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:55d65f4f5cc759ba95d5067e962fa07bf65c8ef3d892aad4f8134a39767a9da5","observation_id":"d8aea3a9-ae68-4007-bee3-80b756e9160e","resolution":{"observed_at":"2026-08-12T17:04:12.943907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.925579Z","title":"Multi-frame, lightweight & efficient vision- language models for question answering in autonomous driving, 2024","venue":null,"work_id":"d6aa1d88-f969-4f56-8621-4f8c189fdbc1","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.427829Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:f3d62ee0140ac0e371ba2854860dfab3f5648e36a67da016151feca02a1ade25","observation_id":"538aa569-23ce-4222-b5e1-06dda7eca6ca","resolution":{"observed_at":"2026-08-12T17:04:12.929941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.912290Z","title":"Lan- guage is not all you need: Aligning perception with language models","venue":null,"work_id":"7dc12393-e456-4c48-837a-b2912ecc8d1d","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.433051Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:3b0132d75c076f758a905be0612bc3556931eb17a5993ff9fc69fa7d5354c257","observation_id":"a4625a06-954b-4d22-b348-91195ef325f5","resolution":{"observed_at":"2026-08-12T17:04:12.916476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.899256Z","title":null,"venue":null,"work_id":"a146348a-78dc-4866-81f5-71613770998a","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.437309Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:0cce569fd1673c6508c28bb97b5adc66f3626bfb6d29b02c33d39c1eeba79799","observation_id":"ba3795a1-fcc4-443f-8bc1-29b4958c04c7","resolution":{"observed_at":"2026-08-12T17:04:12.903365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.885828Z","title":"Vlm2scene: Self-supervised image-text-lidar learning with foundation models for autonomous driving scene understanding","venue":null,"work_id":"463f33e8-2de0-4d0d-97aa-291b51664e1e","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.441331Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:00b910602104dfc66038a90e983f411b219ccb0e0cce609f3b4b8a0389ae8c9d","observation_id":"6d7d7217-284e-4943-b22a-6c26ee1f3184","resolution":{"observed_at":"2026-08-12T17:04:12.890378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.872482Z","title":"Rouge: A package for automatic eval- uation of summaries","venue":null,"work_id":"335e53d0-2c46-4a11-be79-ffdd2c939317","year":2004},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.446091Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:1c65bc8fb862be2f939c6f4e0d3d01274cd93983eeb00681e9955dda4f56e693","observation_id":"bad55b0c-c5c0-42a3-aaf7-2de3c733c1a4","resolution":{"observed_at":"2026-08-12T17:04:12.876859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.857928Z","title":"Reason2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":"04ca0a13-80e1-4696-b39c-5a296743819d","year":2025},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.450285Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:9568859e5d00ce623a299dde0b41096ee5d2887b47fb4c8686ca18469a75ea48","observation_id":"b553a8a7-9463-4a09-90ec-85fa53af4f8d","resolution":{"observed_at":"2026-08-12T17:04:12.862162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.845097Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"b66fb8d1-e560-4976-8b70-7745fc5ead96","year":2002},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.454302Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:d8d3cb3e6cd51228ea78532e6dcebdfa2db9e28cfca9a9c8c8c80f8aca5bf341","observation_id":"c1ef6a27-0967-4f2a-9925-6cf2dd410e98","resolution":{"observed_at":"2026-08-12T17:04:12.849459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.830757Z","title":"Nuscenes-qa: A multi-modal vi- sual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"34f686ff-6f90-4f0e-9c84-ec96f193a80b","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.458461Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:eb15d5f5afed2942780dc4c181a3d534ca3fa10f5a890df59e7c9ef54ea192c3","observation_id":"ecb3508d-e648-4b9c-8038-f9a54b2c54bc","resolution":{"observed_at":"2026-08-12T17:04:12.835795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.815903Z","title":"Nuscenes-qa: A multi-modal vi- sual question answering benchmark for autonomous driving scenario, 2024","venue":null,"work_id":"b17e8af1-90f6-49bf-b494-2fd963d3a995","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.462299Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:fbd6e504d5dde8f80cbb3fd95e5a4ee75f48b7817fbf343c1f04d8ed06a75ff1","observation_id":"f224662a-2fc6-4579-8a4b-aafadeff4360","resolution":{"observed_at":"2026-08-12T17:04:12.820295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.801740Z","title":"Learning trans- ferable visual models from natural language supervi- sion","venue":null,"work_id":"cfa700cc-9cb4-471f-bdc7-360a06697a39","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.466285Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:ab877917c7dd0452876255db1a787bdcd61a643d7b3adbe9e743b782a8be6e41","observation_id":"61fe9706-91d6-4d97-b1d3-bd4be4186a4e","resolution":{"observed_at":"2026-08-12T17:04:12.806538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.788423Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"f08dccc9-f458-408b-a8d1-c643b45e0a8d","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.470510Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:ead2036725f35adeadc3a0c02e00a672c0c5698366819e20688d4c98120eeef8","observation_id":"6c8d36c6-10d2-4da4-a0f2-dc81b6105dc9","resolution":{"observed_at":"2026-08-12T17:04:12.792941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.773967Z","title":null,"venue":null,"work_id":"a43e7518-cc0d-4b02-a1d4-a0631c1893f8","year":null},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.474717Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:4570a2e9e184804234969f894453ab86158502403f5398b1d2ca1fb4db00e3fe","observation_id":"01bb169f-3f79-4e84-95bf-473735016ed3","resolution":{"observed_at":"2026-08-12T17:04:12.778559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03026","last_updated":"2025-04-15T03:45:30Z","snapshot_observed_at":"2026-08-16T14:55:01.717006Z","submitted_at":"2023-10-04T17:59:49Z","title":"LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03026","snapshot_observed_at":"2026-08-12T17:04:12.479080Z","title":"Languagempc: Large language models as decision makers for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.479080Z"},"links":{"cited_paper":"/paper/2310.03026","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:42273a33c68e046c70c0a24605492720ba014f600e10c82040d3c6f68d9f6100","observation_id":"2dfbf586-d531-4699-bb65-c4f8b611ec18","resolution":{"observed_at":"2026-08-12T17:04:12.479080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-16T14:32:27.353396Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-12T17:04:12.484511Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.484511Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:2aeeaaceead51c458edff9289727b8f1b9fdde86c89cfe8451ae1b11827fb654","observation_id":"84653957-d64b-4755-a4ba-b2c4cc630430","resolution":{"observed_at":"2026-08-12T17:04:12.484511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-12T17:04:12.489019Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.489019Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:1c19b0df9c164cc387b9f15553e7f91d405a4516333a4f8d0b80cfb6e5a22131","observation_id":"5b51f4e3-4620-47fb-8dae-1566368f4a0c","resolution":{"observed_at":"2026-08-12T17:04:12.489019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.760837Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"b4427007-1bbf-4afd-87d4-2c29c92d6b23","year":2015},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.493514Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:8bcad061a761ac5ccb2db8660ab45fff58c25392020b055ff60bb748bf3d6a8b","observation_id":"35c8512b-0fc0-4eab-bb37-bd93adca5750","resolution":{"observed_at":"2026-08-12T17:04:12.765032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.746884Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":"a1835e24-86cb-48cf-826c-9bf4d2e97ead","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.497165Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:b34094acc5f375a75ee1d48e5b6ada8f347fe6c1c02d2324baa3aa4b7619a107","observation_id":"f69c3665-b71d-42e9-a2c5-7c6f890bdb49","resolution":{"observed_at":"2026-08-12T17:04:12.751668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.733433Z","title":null,"venue":null,"work_id":"e2351c82-0858-4ed6-8296-d81b5d5e9fca","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.500769Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:0e67305b00212e6e5830ea6f08d293b7117d0d5b2d46a0f4ab1c9da39a812fbb","observation_id":"15cdc746-7f21-4404-b411-0f9b966323bc","resolution":{"observed_at":"2026-08-12T17:04:12.738054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05332","last_updated":"2023-11-28T09:47:57Z","snapshot_observed_at":"2026-08-16T14:44:40.908781Z","submitted_at":"2023-11-09T12:58:37Z","title":"On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05332","snapshot_observed_at":"2026-08-12T17:04:12.504683Z","title":"On the road with gpt-4v (ision): Early explorations of visual-language model on autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.504683Z"},"links":{"cited_paper":"/paper/2311.05332","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:1e9f5699c77e08a0012313ad8fe8cfeb93864182e5f3d9e78fe49ff7bf8aaf92","observation_id":"c36ce008-a22d-42ed-92d7-eeac749c2f44","resolution":{"observed_at":"2026-08-12T17:04:12.504683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.719948Z","title":"Drivegpt4: Interpretable end-to-end au- tonomous driving via large language model","venue":null,"work_id":"e711a769-34c6-4b25-acef-c705efdfba4e","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.508759Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:9159e5fbb9b1c981dfd6933803a38f62cbd478d96db95f2950e43a392844b600","observation_id":"886f1fca-9726-41e7-ba3f-309ae6077c0f","resolution":{"observed_at":"2026-08-12T17:04:12.724266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.703327Z","title":"Generalized predictive model for autonomous driving","venue":null,"work_id":"49fd20ee-7088-45dd-8e9b-84ebeb64ff3f","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.512334Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:dccbae78cd735bd776086d78a689671ebc435111831406abb8f34bec7e95091f","observation_id":"ec8d9c15-47d0-4e7d-a638-83c0f32f72fd","resolution":{"observed_at":"2026-08-12T17:04:12.708896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.686390Z","title":null,"venue":null,"work_id":"c044a57d-d490-430b-be01-ec195977d8bf","year":2022},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.516332Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:db34158f031b67f359f06dd3298b183fc065f9aa024d045bef16420235da987c","observation_id":"c18a6a17-0799-481b-a108-076ff5cd00e6","resolution":{"observed_at":"2026-08-12T17:04:12.691591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.670281Z","title":null,"venue":null,"work_id":"072410e8-bb6f-415b-8c5f-8c60c5e72f48","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.521039Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:26235ae65f7177f3df503d07cac6714fe4ad56a7801ac40d1161ab4ae55690d0","observation_id":"89310149-e210-4e64-9f4a-f30d081609b5","resolution":{"observed_at":"2026-08-12T17:04:12.675307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.654872Z","title":"Zhang, L","venue":null,"work_id":"007ca5c5-8e0d-42f1-9950-42aabb23f985","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.526011Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:43aa9dea8ccceaabe98cc13d78fcb0bafc92aacbbdb862c5f814856f46f491c2","observation_id":"0f57dc8e-2d87-49ac-805a-5f9b85c6f755","resolution":{"observed_at":"2026-08-12T17:04:12.659776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.638172Z","title":"Vinvl: Revisiting visual representa- tions in vision-language models","venue":null,"work_id":"b502e809-ac29-49f7-b30b-2de52a689e3f","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.530750Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:3e45b8a0b34cdaae53e9e5cb3304eb64ae3778db3d40a69578d6a150b40e16c2","observation_id":"6517acc2-d355-421e-87a7-9ab5d979b4c1","resolution":{"observed_at":"2026-08-12T17:04:12.643933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.620724Z","title":null,"venue":null,"work_id":"9bf66c9f-ff24-4361-a33a-bae75fd0dd23","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.534638Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:be6e625f4250ae3af804ec02785d6ab4fecbcde42bc303d382f2adc368573c57","observation_id":"3794ec17-d05f-4a00-9956-3b7668594d7e","resolution":{"observed_at":"2026-08-12T17:04:12.626385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:40:33.391675Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2411.12980."}