{"as_of":"2026-08-17T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:649fb7f8e999a85f74bdb337e31e41324a47d6286f4a815c8b499094251859c3","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:29:54.820604Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.07084/citation-record","integrity":"/paper/2505.07084/integrity","json":"/paper/2505.07084/citation-record.json","paper":"/paper/2505.07084"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.325383Z","title":"A holistic robust motion control framework for autonomous platooning,","venue":null,"work_id":"cd51f034-cd22-4e8f-9c0d-27bb88811fb2","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.642437Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:07ad4fc5a13d8a2396601264795f3d0500f694ef550f9841d82be80a2830fc50","observation_id":"46b64b86-d5e1-43e5-94b0-7b51ac3b73d4","resolution":{"observed_at":"2026-08-15T22:29:55.328863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.315698Z","title":"A survey on an emerging safety challenge for autonomous vehicles: Safety of the intended functionality,","venue":null,"work_id":"cf080979-a8a7-4e20-9537-82881c49534d","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.646944Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:210d4dced7817e43950631dd201bb830813d807ce4e9f757b5a30be6002f187d","observation_id":"7cc2ee29-394f-40d7-b4b9-6e5e3edb318f","resolution":{"observed_at":"2026-08-15T22:29:55.319248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.306036Z","title":"Sotif entropy: Online sotif risk quantification and mitigation for autonomous driving,","venue":null,"work_id":"b1d99a56-9cbe-40b4-ba8c-5f7ef61741b9","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.650419Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:51bda3fc6485cad89020d1456b5c839d543505a134e0c12fd8a95d532acd4152","observation_id":"d4b8a711-22db-4e15-b3e6-fd2dfe32d7ea","resolution":{"observed_at":"2026-08-15T22:29:55.309427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.295854Z","title":"Pesotif: A challenging visual dataset for perception sotif problems in long-tail traffic scenarios,","venue":null,"work_id":"bd5700fd-7b07-4f1a-8cfa-ba57100c8c7e","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.654024Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:c2f9374ca49475d64deb3e5be492bd2207472e7fd54fba7898339940e565d028","observation_id":"0cc07648-4951-4ff0-bb73-9781a85c92b5","resolution":{"observed_at":"2026-08-15T22:29:55.299979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.286118Z","title":"Multi-modal answer validation for knowledge-based vqa,","venue":null,"work_id":"5b1a6963-ab95-4550-9ada-5d5dfda77176","year":2022},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.657603Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:1c64070399f68290e9168d28c25f611677c51c4f65c3051745e4cdbc7c3e791e","observation_id":"96f132e6-bfe6-43e2-b5fb-baa52b4601ff","resolution":{"observed_at":"2026-08-15T22:29:55.289494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.274799Z","title":"Context-vqa: Towards context- aware and purposeful visual question answering,","venue":null,"work_id":"9281d8b2-1494-491c-9e59-7fbc8ace5c12","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.661203Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:332cb8d484253279a39687116d1a923a167ea3a794f98d4cdaa86f8f2f5c1a67","observation_id":"5c50d009-e0c0-4f99-9bb8-7ce3852b80d5","resolution":{"observed_at":"2026-08-15T22:29:55.279321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07724","last_updated":"2022-09-17T04:52:35Z","snapshot_observed_at":"2026-08-16T17:14:30.495001Z","submitted_at":"2022-03-15T08:32:56Z","title":"CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07724","snapshot_observed_at":"2026-08-15T22:29:54.664755Z","title":"Coda: A real-world road corner case dataset for object detection in autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.664755Z"},"links":{"cited_paper":"/paper/2203.07724","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:85588f024ebbd751fd6429bba4910b5ed9cb57e44f455aa7fff872936de97323","observation_id":"73245253-0d0d-44d8-9e8c-07e3d677d042","resolution":{"observed_at":"2026-08-15T22:29:54.664755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.265683Z","title":"Simulation-based performance evaluation of 3d object detection methods with deep learning for a lidar point cloud dataset in a sotif-related use case,","venue":null,"work_id":"92e2e744-4fda-49a9-af55-c66aa1274121","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.668454Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:e2e3d94f0e3fc454b0d29e99e462567f84b3da10d8b33e8ed18d03b876423b27","observation_id":"852d2156-8d11-4cd0-8905-5566c6d68739","resolution":{"observed_at":"2026-08-15T22:29:55.269004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10595","last_updated":"2024-12-06T01:54:59Z","snapshot_observed_at":"2026-08-16T14:00:28.845908Z","submitted_at":"2024-04-16T14:20:55Z","title":"Automated Evaluation of Large Vision-Language Models on Self-driving Corner Cases","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10595","snapshot_observed_at":"2026-08-15T22:29:54.671697Z","title":"Automated evaluation of large vision-language models on self-driving corner cases,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.671697Z"},"links":{"cited_paper":"/paper/2404.10595","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:dbd3f388b25ddb12e2d310370be37c9b8199ca9e448b40d9f21ed7cd8e8a5272","observation_id":"f88aa260-008f-4e0b-9ee8-99087bfb7a06","resolution":{"observed_at":"2026-08-15T22:29:54.671697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.256423Z","title":"Enhancing autonomous vehicle safety based on operational design domain defi- nition, monitoring, and functional degradation: A case study on lane keeping system,","venue":null,"work_id":"4becac1f-e118-4789-b201-cd1a3024ce8a","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.675246Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:9ea75b4e7e6d8543d3636a7ee57722c55416f424cb783e1408e579132c14c8ef","observation_id":"a924ca6b-d498-4d65-938a-59aa82a2395d","resolution":{"observed_at":"2026-08-15T22:29:55.260103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.247459Z","title":"Sotif-oriented percep- tion evaluation method for forward obstacle detection of autonomous vehicles,","venue":null,"work_id":"ca959776-3eb6-4f7b-9af0-1ca0827b7494","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.678423Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:008c702dc9a89e00f9ee7eb5e9aa7895b3d42570ba10384a355a528023668ccd","observation_id":"e3b557f6-f83f-43f0-9521-eb9712307c92","resolution":{"observed_at":"2026-08-15T22:29:55.250743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.238328Z","title":"The sotif meta-algorithm: Quantitative analyses of the safety of autonomous behaviors,","venue":null,"work_id":"653ae12c-88ea-41b5-91fd-ae05283ff19d","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.682201Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:c3cabafa6939eb7f1b5c97eeed9015b28a96e240575c33a8c650e864b6d08a97","observation_id":"05235559-8731-4a8c-9456-f672812c62ca","resolution":{"observed_at":"2026-08-15T22:29:55.241685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.228199Z","title":"A hazard analysis approach for the sotif in intelligent railway driving assistance systems using stpa and complex network,","venue":null,"work_id":"d502f1aa-9849-4c2b-9ab5-4790658dd354","year":2021},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.685310Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:9880b3b409a8f384c22ecf73208297b86538067efdc1a743c47ac3a4aeb16f47","observation_id":"00407ee8-a828-44bf-9e15-14a62d08664f","resolution":{"observed_at":"2026-08-15T22:29:55.231610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.218880Z","title":"Safety of the intended functionality (sotif) based on system theoretic process analysis (stpa): Study for specific control action in blind spot detection (bsd),","venue":null,"work_id":"72f7b2b9-947a-4c76-9f59-b5007e5b971c","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.688551Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:36558c2aea3b8fc4b3e65814145df58b2954ceaa68f30fbcc03516861655d3c4","observation_id":"19804e08-fff1-4471-8ace-f86518bc4018","resolution":{"observed_at":"2026-08-15T22:29:55.222175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.207871Z","title":"Formal cer- tification methods for automated vehicle safety assessment,","venue":null,"work_id":"297ea146-581b-49a1-8adc-0a10097530ee","year":2022},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.691865Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:7387e278fec1133f9500b5df3f87ad17eb355ea6160aa48ca4a203f4a979abc7","observation_id":"71aab8f8-35b1-499f-95fa-c5f944899136","resolution":{"observed_at":"2026-08-15T22:29:55.212108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.198224Z","title":"Systematic modeling ap- proach for environmental perception limitations in automated driving,","venue":null,"work_id":"5e732ea3-995b-43d3-99d7-a930bc90a1a0","year":2021},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.695079Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:f305144175ba31f14851a4d81d45f3e1431ab922157733b5bbf87f91019166af","observation_id":"8a562cba-ab94-49f0-9a37-e6317d4be6a6","resolution":{"observed_at":"2026-08-15T22:29:55.201684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.188385Z","title":"Decomposition and quan- tification of sotif requirements for perception systems of autonomous vehicles,","venue":null,"work_id":"f733130f-9e3a-45d9-a3a9-f1876505040b","year":2025},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.698250Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:1b8d45a01cdd12bd9b1851a238a3c9dd5020f4e7c73cccac37e0b2cb16b8735d","observation_id":"c8a783b0-c624-4284-a950-697bfb4d9e07","resolution":{"observed_at":"2026-08-15T22:29:55.192369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.177877Z","title":"Online quantitative analysis of perception uncertainty based on high- definition map,","venue":null,"work_id":"2fedb31c-f6f1-4e2c-82cd-bd55dc39453c","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.701499Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:939e9d4ae4280fef7f36004b2119a46ee0ee137240120e21c2ac890df4fa162a","observation_id":"76c3cb82-d18d-42af-a172-2380f7f728fd","resolution":{"observed_at":"2026-08-15T22:29:55.182003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.167138Z","title":"Towards causal vqa: Revealing and reducing spurious correlations by invariant and covariant semantic editing,","venue":null,"work_id":"dbfd0326-6076-496f-b9ad-74686d8e6388","year":2020},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.704597Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:af968677ea0a0adeaef089b609a541e4afd3ad5956a53893a431a3ad94ee7ed3","observation_id":"4219b357-3f28-4387-a7a4-672ddf0ed6c1","resolution":{"observed_at":"2026-08-15T22:29:55.171141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.156647Z","title":"Drivellm: Charting the path toward full autonomous driving with large language models,","venue":null,"work_id":"84eda235-2ac5-46f8-a7e7-3215cb9f8ef6","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.708051Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:ea9a686919785a65225c6921096608e06d72e661441d39bd26586af64aa69acc","observation_id":"3c0229bb-9ef0-484d-a319-f94e6d8c4689","resolution":{"observed_at":"2026-08-15T22:29:55.160212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.711204Z","title":"Driving with llms: Fusing object- level vector modality for explainable autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.711204Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:66ba0aee5e3c3509a90900ee8ea5af0b30053f50b83fde94ce3e8e8b925d36a4","observation_id":"c9f1ba13-06d1-4dc6-832e-89847479b820","resolution":{"observed_at":"2026-08-15T22:29:54.711204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04821","last_updated":"2024-10-03T00:06:02Z","snapshot_observed_at":"2026-08-16T13:27:33.403540Z","submitted_at":"2024-08-09T02:27:25Z","title":"VLM-MPC: Vision Language Foundation Model (VLM)-Guided Model Predictive Controller (MPC) for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04821","snapshot_observed_at":"2026-08-15T22:29:54.714301Z","title":"Vlm-mpc: Vision language foundation model (vlm)-guided model predictive controller (mpc) for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.714301Z"},"links":{"cited_paper":"/paper/2408.04821","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:55fb0f5316c00e3890cad1c66ca74e07d2078273bbf5e9e33d6e88a44a578c1f","observation_id":"a0e3d80c-b9ed-4c79-90c7-fc6be35d14cc","resolution":{"observed_at":"2026-08-15T22:29:54.714301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.139751Z","title":"Scene understanding for autonomous driving using visual question answering,","venue":null,"work_id":"be24459b-fb70-4671-a9a7-47d4f0b0c84c","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.717707Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:c364dc808c2d4d2295488fef15f0ad34fba61819623df2f9c2e4961a1a6ab004","observation_id":"63bca8eb-f201-4ec8-8110-aea7246f8399","resolution":{"observed_at":"2026-08-15T22:29:55.144045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.720784Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.720784Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:e5590229e44bc8263833eb7c69b5fe063961787c63d5373764ca928020351b4f","observation_id":"ee408494-4133-4f7c-8f51-c8ece088a1d1","resolution":{"observed_at":"2026-08-15T22:29:54.720784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.122464Z","title":"Explaining autonomous driving actions with visual question answering,","venue":null,"work_id":"faf03039-8797-4c5a-a2ed-e24d724fb23f","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.724099Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:ed1ac8f7e061aeb3f761f75cd6ff2213a30873a6cd98f67f1981d439b18285cd","observation_id":"77deb080-5531-476b-a481-9c0a3fd65c76","resolution":{"observed_at":"2026-08-15T22:29:55.126937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-08-13T20:16:41.272728Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-15T22:29:54.727447Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.727447Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:cca17da322fec11a2d2de42bb8242f4a481ecbf99c63a3893baf5c89f6bed0d5","observation_id":"82ff2c98-48a3-4da4-935d-06f6c562cf89","resolution":{"observed_at":"2026-08-15T22:29:54.727447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19838","last_updated":"2024-05-09T03:27:44Z","snapshot_observed_at":"2026-08-16T14:05:21.581063Z","submitted_at":"2024-03-28T21:18:33Z","title":"Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19838","snapshot_observed_at":"2026-08-15T22:29:54.731003Z","title":"Multi-frame, lightweight & efficient vision-language models for question answering in autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.731003Z"},"links":{"cited_paper":"/paper/2403.19838","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:4462f59b4590968839f123e5da4687c7a66e13d4ca7ca67fc9cd134c364a4aac","observation_id":"e4ea5224-34b7-485b-bf84-20fb8a0f16e0","resolution":{"observed_at":"2026-08-15T22:29:54.731003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.112358Z","title":"Drama: Joint risk localization and captioning in driving,","venue":null,"work_id":"509a2ab5-37e9-4551-9f1d-44269ba78157","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.734596Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:436f1866c776583b7663a4186c66dc56f50dcf387ed8a7b6ce3f31c069e64a3d","observation_id":"451be2cc-3810-430e-a1df-cd1b4f64d60a","resolution":{"observed_at":"2026-08-15T22:29:55.115916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.102569Z","title":"Referring multi-object tracking,","venue":null,"work_id":"2f440e23-0c32-45a9-a61d-66c3a92c1fed","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.737923Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:06c6f799dc4e382e7036540ade435767125a21d5e1f81d71d856bad2a974a36e","observation_id":"3723ccbd-3c21-457a-8421-c908c6fae8d0","resolution":{"observed_at":"2026-08-15T22:29:55.106127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-15T22:29:54.741051Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.741051Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:8cd8f36f19fdf1aa1f4a27180091ef647dd71fb1e6286e7268febfe3f955943b","observation_id":"2088789f-d601-4812-857e-17ad26a5502d","resolution":{"observed_at":"2026-08-15T22:29:54.741051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.092635Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"962af6ff-e0e0-4f52-908d-dcadb64d244f","year":2017},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.744672Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:de50fe65359a7ca1746ea65b4d3bf5fb3eb9b87180f6e51135a0ac858bbd07f2","observation_id":"e580f922-9d48-4390-81ef-de0b8f662e33","resolution":{"observed_at":"2026-08-15T22:29:55.096080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.747867Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.747867Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:edcbad583a1c141e9fbb92197bb9940f9f509ca8e11c7b86497e9131e056bdb2","observation_id":"00262dd7-76b9-4726-831d-df780c21d896","resolution":{"observed_at":"2026-08-15T22:29:54.747867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.751096Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.751096Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:91a58fe0cecb2182f15dad6642c722f5a225b2dccab75c7de4df90f5d9c2b400","observation_id":"e25fa1a8-aa61-42b0-a797-2018c82bbc48","resolution":{"observed_at":"2026-08-15T22:29:54.751096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.754213Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.754213Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:4dccb62a08a0c2fcd28b3ba653004fd417eb437efb90d22cd26c03b154d10cc5","observation_id":"01237a3f-619e-40df-8396-a0b309e4bfc6","resolution":{"observed_at":"2026-08-15T22:29:54.754213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17489","last_updated":"2025-03-21T18:59:20Z","snapshot_observed_at":"2026-08-16T12:47:51.055316Z","submitted_at":"2025-03-21T18:59:20Z","title":"Judge Anything: MLLM as a Judge Across Any Modality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17489","snapshot_observed_at":"2026-08-15T22:29:54.757189Z","title":"Judge anything: Mllm as a judge across any modality,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.757189Z"},"links":{"cited_paper":"/paper/2503.17489","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:b7fe0c259a8998303920e4254b7513f07ae3a6ce410135b67ca4473f797c12f1","observation_id":"9e3e05d4-7447-44bb-84dd-44b438aad7c3","resolution":{"observed_at":"2026-08-15T22:29:54.757189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.760786Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.760786Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:bce2efceddeefcdf02c90089af56c2d5820aebf3c01d7d3e1cbac472e832579d","observation_id":"1792280e-73aa-4912-a9af-55f00774f848","resolution":{"observed_at":"2026-08-15T22:29:54.760786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.763942Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.763942Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:14160ee3c24baa2d9ab87b1cd43100963d4c3155558868b6647cc5b4a8629217","observation_id":"f63bb5fa-8cf4-49b2-a13a-9885ec1cc7c7","resolution":{"observed_at":"2026-08-15T22:29:54.763942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.767003Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.767003Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:c0b5331aa29de3aa840bb33aa8221bef91581a603db0c8d5914310078a7d281f","observation_id":"79343155-fe7a-4cdb-8231-6f28bf60a842","resolution":{"observed_at":"2026-08-15T22:29:54.767003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T22:29:54.769693Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.769693Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:25ae7a3cfdf960facbc9b0010153173290bc5b6746ee9e5eb87655490115f86a","observation_id":"49174d0a-cfd0-465f-b4bd-94e858efdc42","resolution":{"observed_at":"2026-08-15T22:29:54.769693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T22:29:54.772797Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.772797Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:614ad87defbc06ec292e2db56afb38426166f98dbfda14f9dbc6027d4615f4ce","observation_id":"0bc66d7f-f9e9-4a12-920b-7d3bc587a902","resolution":{"observed_at":"2026-08-15T22:29:54.772797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T22:29:54.776155Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.776155Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:52456ba3c2c80b741e23de2c954ffa4c27d111b653715baa8dcf3282f60464b3","observation_id":"01893d7a-a86d-4c02-bd13-f0c42186a738","resolution":{"observed_at":"2026-08-15T22:29:54.776155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T22:29:54.779436Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.779436Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:5a2cf0fa2fd697105649178d6666891a118d602be4f159bc2ba8829f2f7cc77b","observation_id":"06ef0d92-e2ae-44f7-b28e-7cfa5e9d2e12","resolution":{"observed_at":"2026-08-15T22:29:54.779436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.051062Z","title":"LA VIS: A one-stop library for language-vision intelligence,","venue":null,"work_id":"28790a13-11e3-40a9-bcc7-f56b2c5eb3d1","year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.782476Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:2e7356e4060f232f4003e344e4997e8c0efee67f6a26900932f3d3e3df694c5d","observation_id":"c7397c6c-1fb6-4475-a94f-57ad15c34ca9","resolution":{"observed_at":"2026-08-15T22:29:55.054754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-15T22:29:54.785776Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.785776Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:03037a04764ab993960b04cc66c60807aff4702da246e102b1feb3ffe4ad1645","observation_id":"12b0af8c-3221-4f41-867e-6e4052e0bfa6","resolution":{"observed_at":"2026-08-15T22:29:54.785776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.040754Z","title":"TensorRT-LLM,","venue":null,"work_id":"fc18d5ce-4c1d-43c1-940b-eee4f1d265db","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.789211Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:94d0f15e97abcb3bf21864d55641f6eb74bfaa4007589704e6d482cc41e0a446","observation_id":"7ef106db-afe3-4eca-b312-f51ccc38a32a","resolution":{"observed_at":"2026-08-15T22:29:55.044107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.792756Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.792756Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:9010693384dfa68149519f105e607d9a60bf6b41a99f41297d9f87bbf510d167","observation_id":"b4220204-30f7-4b63-b043-700143b1478a","resolution":{"observed_at":"2026-08-15T22:29:54.792756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06875","last_updated":"2025-05-11T06:55:54Z","snapshot_observed_at":"2026-08-15T23:14:16.833046Z","submitted_at":"2025-05-11T06:55:54Z","title":"Towards Human-Centric Autonomous Driving: A Fast-Slow Architecture Integrating Large Language Model Guidance with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06875","snapshot_observed_at":"2026-08-15T22:29:54.795961Z","title":"Towards human-centric autonomous driving: A fast-slow architecture integrating large language model guidance with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.795961Z"},"links":{"cited_paper":"/paper/2505.06875","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:0d8b2097c900673093968f3ec9075198947ffca3797a13923c22aa671c791335","observation_id":"bbd5893c-327a-4e9a-9797-d751232f4e45","resolution":{"observed_at":"2026-08-15T22:29:54.795961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20342","last_updated":"2025-07-27T16:15:21Z","snapshot_observed_at":"2026-08-17T05:47:15.172784Z","submitted_at":"2025-07-27T16:15:21Z","title":"VLMPlanner: Integrating Visual Language Models with Motion Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20342","snapshot_observed_at":"2026-08-15T22:29:54.799574Z","title":"Vlmplanner: Integrating visual language models with motion planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.799574Z"},"links":{"cited_paper":"/paper/2507.20342","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:7529933a846d795b31c00349cb866001451e688ae29d223b2783900ef77f1066","observation_id":"430ff2b3-3d49-4c12-9e90-9f78dc6224ac","resolution":{"observed_at":"2026-08-15T22:29:54.799574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.024906Z","title":"Canadian adverse driving conditions dataset,","venue":null,"work_id":"1a8564ae-f138-4e64-836c-95ac8c044828","year":2021},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.803567Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:aa9602749a776cf1b92b30cd7d9a4b956b71882eb2d30a7c39e4bfa18d3c95b7","observation_id":"0fd600ec-0e51-427f-a690-266130e510a2","resolution":{"observed_at":"2026-08-15T22:29:55.028217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-15T22:29:54.807314Z","title":"Safe rlhf: Safe reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.807314Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:c9f639b6b21cee87e0f707ed8d311adea5050c42aba0a1c68eb3985849e366c9","observation_id":"9822037e-2cb3-41c5-bdf7-b701dac82b8e","resolution":{"observed_at":"2026-08-15T22:29:54.807314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-08-16T12:38:46.158503Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-15T22:29:54.810696Z","title":"Siren’s song in the ai ocean: a survey on hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.810696Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:5ea3c02995b20dfdf2fd57246fa938a32d0dd87209d3966fe2ccfc087561436c","observation_id":"47041eae-e0ac-474b-a444-8aa83f236321","resolution":{"observed_at":"2026-08-15T22:29:54.810696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:54.814475Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.814475Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:a6010dcd158c49e3cb28b69ac9f85d4c2a834dbb84ef1a070011a598264dd77d","observation_id":"4f88fff4-c8b0-4fb3-bf11-6c00db24f296","resolution":{"observed_at":"2026-08-15T22:29:54.814475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:29:55.007852Z","title":"Rlaif vs. rlhf: Scaling reinforcement learning from human feedback with ai feedback,","venue":null,"work_id":"39a54a35-39b8-4d97-abba-1249c5e09203","year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.817524Z"},"links":{"citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:8014ee1f28c6c09397bc2188855ca108a0c0cc245307992e3a480b96d95a6340","observation_id":"0bca7d1b-2853-42e1-9ace-42286c56d3d6","resolution":{"observed_at":"2026-08-15T22:29:55.013397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15778","last_updated":"2024-10-22T05:01:28Z","snapshot_observed_at":"2026-08-16T13:07:30.665879Z","submitted_at":"2024-10-21T08:42:30Z","title":"Reducing Hallucinations in Vision-Language Models via Latent Space Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15778","snapshot_observed_at":"2026-08-15T22:29:54.820604Z","title":"Reducing hallucinations in vision-language models via latent space steering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:29:54.820604Z"},"links":{"cited_paper":"/paper/2410.15778","citing_paper":"/paper/2505.07084"},"observation_digest":"sha256:981035467aac7815fa0c3d854dda337ef79106de188feb1059c0b46ffb5d4bd9","observation_id":"55fb241e-8f23-4ed5-86ef-d71ce61e03de","resolution":{"observed_at":"2026-08-15T22:29:54.820604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07084","last_updated":"2025-09-09T06:37:28Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T23:14:33.715517Z","submitted_at":"2025-05-11T18:14:33Z","title":"DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2505.07084."}