{"as_of":"2026-08-09T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b955d6e0ec0940f1b1bd7a695df9e5e524809f16e562ce65bd6bb1f21c89c56","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:34:24.666268Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16938/citation-record","integrity":"/paper/2607.16938/integrity","json":"/paper/2607.16938/citation-record.json","paper":"/paper/2607.16938"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.116517Z","title":"Geiger, P","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.116517Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:b6fd9aef165b69b91b00f869681f574671b84d2fa60c6b7a2eed6c7b26e56d76","observation_id":"8271537e-40cd-4efd-a7df-52bcec64b9a2","resolution":{"observed_at":"2026-08-01T19:34:20.116517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.189143Z","title":"Caesar, V","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.189143Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:70fe37122c0bb1bf0129882351d536850ca81b99bd67594a9934ab537d12a285","observation_id":"ba40a61b-b26d-4c54-a89e-932e98453e9e","resolution":{"observed_at":"2026-08-01T19:34:20.189143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.286307Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.286307Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:0b359664e6e25157bd66ab952ec2f2c2af8e3e0a7b44d05e08f012466023fbb1","observation_id":"5f035aad-de0a-47ea-aaef-132d3126bae8","resolution":{"observed_at":"2026-08-01T19:34:20.286307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.409854Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.409854Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:b00f09f4ec2506fe630fd6e2156300adb424893fb5d95155203c94a6e9cc16f3","observation_id":"cc919111-8e2b-4805-acaf-ebb25f0079a7","resolution":{"observed_at":"2026-08-01T19:34:20.409854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.526699Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.526699Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:0a12fadd764ba9ce4d7bbae39ec2cff1253dc57e86c8ff873bd281ec74ceb15b","observation_id":"c04578cb-7546-4966-b84a-e06fed04f49b","resolution":{"observed_at":"2026-08-01T19:34:20.526699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.603799Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.603799Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:86eb8cf0c12fbb4c12e399082b21d1c0adb6ef080b1283acc60d9572d9a075fb","observation_id":"cf4b3e37-f6ba-48d0-9155-2e37426f32d4","resolution":{"observed_at":"2026-08-01T19:34:20.603799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.662423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.662423Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:e5a82a2475c58aef5bd0f0bc3bac0cc3ff2fa28cd94b243b5f57b051eaa7713b","observation_id":"bf10c83b-bb21-44c2-a6f0-160bdc9751ed","resolution":{"observed_at":"2026-08-01T19:34:20.662423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.759953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.759953Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:f58a8ad3b2461ec567cd7b3393672ef98f8fc5bba2d5245d71cf94150f93e9a6","observation_id":"3aea71dc-0b12-45ac-84f6-35a9c5f4e64a","resolution":{"observed_at":"2026-08-01T19:34:20.759953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.859924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.859924Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:a6bb25c651170c0b75cc50d7c7272e22287fe894911e65fc7dd6477e2a79ebf3","observation_id":"c8dfc3cc-5b2c-4179-8e15-6d3b3b704a73","resolution":{"observed_at":"2026-08-01T19:34:20.859924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:20.932272Z","title":"EMMA: End-to-end multimodal model for autonomous driving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:20.932272Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:d57fa189601e6971b93cf28067a2a9da17a41b84d50a52f995448912815549ff","observation_id":"93aed823-989c-4808-bdbc-7a4a96ee3337","resolution":{"observed_at":"2026-08-01T19:34:20.932272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.004691Z","title":"de Haan, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.004691Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:dd57c0f72a78c704eb2f522517d12d682e9678f9cd07ddb2599193efdb34af3f","observation_id":"580cd4c1-21eb-4e1f-85a4-b27c2342ed6e","resolution":{"observed_at":"2026-08-01T19:34:21.004691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.116346Z","title":"Bansal, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.116346Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:f4916084f5b423ac987b559818ce70f647ee52f9f6c6a5f191bfbee17f88e8d5","observation_id":"a87c3828-e785-42f1-8be4-a81281d80d4f","resolution":{"observed_at":"2026-08-01T19:34:21.116346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.249090Z","title":"Roelofs, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.249090Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:ef96f6384b3bc39baf3262d87d17731cb52e571ebc9e0463e67b2f3c76cb2b42","observation_id":"3ce73b01-c684-4830-95f7-26f722ff4d7d","resolution":{"observed_at":"2026-08-01T19:34:21.249090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-07-06T03:31:30.452356Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-01T19:34:21.329443Z","title":"Simonyan, A","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.329443Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:4c4d1895836f2a084a3b53b83b2e4ea587aece8a4ee0f1ae9f4fbe3ac098509d","observation_id":"2c8ebc9d-7dcf-4abf-b4c8-4e797328a6e2","resolution":{"observed_at":"2026-08-01T19:34:21.329443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.441018Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.441018Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:0e5ed625d032fda6d6db2519bae3084facd471a02c227eb5f1fef20c60b6d48d","observation_id":"a5095898-fcac-4206-b1aa-da5c31dca7fd","resolution":{"observed_at":"2026-08-01T19:34:21.441018Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.581713Z","title":"Petsiuk, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.581713Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:1952e00627dbc5eaf135594f1974d0305d16ca153dab34e995cc39a637676191","observation_id":"34b5bd8b-85cf-42f2-b220-824aa9919b43","resolution":{"observed_at":"2026-08-01T19:34:21.581713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07874","last_updated":"2017-11-25T03:53:32Z","snapshot_observed_at":"2026-07-06T05:43:42.722222Z","submitted_at":"2017-05-22T17:38:10Z","title":"A Unified Approach to Interpreting Model Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07874","snapshot_observed_at":"2026-08-01T19:34:21.661079Z","title":"Lundberg and S.-I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.661079Z"},"links":{"cited_paper":"/paper/1705.07874","citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:a22ebf324bc239164dc7551e49f9634e14b4a7af2c55dc3a615752cb92eb8959","observation_id":"7914dd93-49e0-41d7-8fce-4524a094503b","resolution":{"observed_at":"2026-08-01T19:34:21.661079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.722187Z","title":"Greer, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.722187Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:e7f6479b17c8a6143ac9e82b1b1ae356ef5d31b8c7bc1afe75d4d765d6bf6e35","observation_id":"5b9c144a-18f8-42ce-b1df-befcc879df4e","resolution":{"observed_at":"2026-08-01T19:34:21.722187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.781751Z","title":"Greer, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.781751Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:106c57ba27ca080e6edce5965a5b38ed3816f22f99fa72236e3529f917a99b8f","observation_id":"03386a9b-bddd-4848-8bb9-45f03c95d1d9","resolution":{"observed_at":"2026-08-01T19:34:21.781751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.860663Z","title":"Greer, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.860663Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:17540f409fa215548087b8ea43404c21cb8bf28c184bc00beca7885b39bee5c5","observation_id":"acf94a9a-4f80-4390-9acf-ce73dde38dd2","resolution":{"observed_at":"2026-08-01T19:34:21.860663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:21.956117Z","title":"Chang, E","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:21.956117Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:ad80745fc483e0531f42875a1378f1079a85ccd4312fde1670d30a22d93ce160","observation_id":"201201ac-46cb-4e73-94d5-f77ba340cda4","resolution":{"observed_at":"2026-08-01T19:34:21.956117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i07.6982","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhang, W","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"a9ad54d2-a56b-44c9-a8a5-5155aaeef560","year":2020},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.035060Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:51bbce2b9a27bd4805c9f1dd0766176041b5352f9311af5f1d7d061ded772d85","observation_id":"cc18edd1-206e-43b3-bd9d-63a28cb05501","resolution":{"observed_at":"2026-08-01T19:38:43.073160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07161","last_updated":"2021-11-11T01:58:26Z","snapshot_observed_at":"2026-08-07T21:00:48.945681Z","submitted_at":"2021-09-15T08:54:29Z","title":"Resolution-robust Large Mask Inpainting with Fourier Convolutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07161","snapshot_observed_at":"2026-08-01T19:34:22.129212Z","title":"Suvorov, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.129212Z"},"links":{"cited_paper":"/paper/2109.07161","citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:d0b68f444197ddc6621a627bad743598b9caf78a010cf8bf42211b7965b04a6e","observation_id":"796b5949-d6f4-4f94-a4ac-e76414f6352d","resolution":{"observed_at":"2026-08-01T19:34:22.129212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T19:34:22.219284Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.219284Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:88cc6cf6e6b9152510c754772831f6ec0b9724f662f3f4c886e72293126ad6ba","observation_id":"ffe3da43-1365-4ab2-80d2-af16863c6375","resolution":{"observed_at":"2026-08-01T19:34:22.219284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.291408Z","title":"Greer, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.291408Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:244be5be26f1400a7451d7649cac6cd0cec08cdc5b6d3b5a52213ceb44ed0f13","observation_id":"5adb61e6-8995-4bc3-aef1-12baaff420ca","resolution":{"observed_at":"2026-08-01T19:34:22.291408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.360791Z","title":"Elhage, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.360791Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:40cc7a8fa84960437dfc625a10399eaca2845f483d4270f459b6338203636557","observation_id":"10a6ac54-d6a3-48c2-b28a-19a9e18acebd","resolution":{"observed_at":"2026-08-01T19:34:22.360791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.460076Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.460076Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:7661c1da4b7bb80c6754c8c2904a6148e7da8262f738962d51d2461e4643535e","observation_id":"950219bb-1f11-455a-a0db-863dad372bf7","resolution":{"observed_at":"2026-08-01T19:34:22.460076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.543677Z","title":"Bricken, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.543677Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:4055a07f7706d4fce1cc53d319b2df607106a7f6dc8ef2d127cb7270c37dbb5c","observation_id":"782fc07f-e3eb-4879-8bec-438701dc129b","resolution":{"observed_at":"2026-08-01T19:34:22.543677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.694078Z","title":"Cunningham, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.694078Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:492a5a2fee08c79ffc30806d1283d01b5aeb102fb11d4f9d114ff55c7e25b33f","observation_id":"29c89ce5-9325-48e0-bc7a-0ee13266845c","resolution":{"observed_at":"2026-08-01T19:34:22.694078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.757703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.757703Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:3c3044f138d2eb84de8eae638f91c327edffe19289601d2d3ae24c244c75cbfb","observation_id":"1a5c92c2-c515-4397-9f7a-efbe54832461","resolution":{"observed_at":"2026-08-01T19:34:22.757703Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.831579Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.831579Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:bf53ec0158f0b30f9b686eb3793804d66b0c51b599bf5256b33510ff94f9862d","observation_id":"bc1eba0f-1187-4c17-ad57-cbf30e85427c","resolution":{"observed_at":"2026-08-01T19:34:22.831579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:22.937202Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:22.937202Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:f8872cb5393cedd95100f8ba2fbfa1239df86cb0ba71824f9197da1fb160d4e5","observation_id":"dc531b04-9074-4be3-8d7f-a09bb04e9cb6","resolution":{"observed_at":"2026-08-01T19:34:22.937202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:23.119157Z","title":"Alpamayo-R1: Bridging reasoning and action prediction for generalizable autonomous driving in the long tail, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.119157Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:1dd0cc91b5cbbfa95420984b2a8f6b26a0459f87f3bf7cc9fbf1e148c1855c3f","observation_id":"a4ec5622-ba77-4732-8bba-278433217db2","resolution":{"observed_at":"2026-08-01T19:34:23.119157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:23.273579Z","title":"NVIDIA Alpamayo: Open reasoning vision-language-action models for au- tonomous vehicle development.https://developer.nvidia.com/drive/alpamayo, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.273579Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:8633adbf47f752bfec2b7545f360bc9f4378441e3d87483fd7ddf83ad3d802e0","observation_id":"d6fc080d-82e8-4fe9-96b2-67162d537d7e","resolution":{"observed_at":"2026-08-01T19:34:23.273579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:23.404625Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.404625Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:0c25adf1858757d9ddfbc460dcc50afcb372736dee43a6f317a0effea501416f","observation_id":"31a75ac6-bbce-4512-b9f2-e00df6eb623c","resolution":{"observed_at":"2026-08-01T19:34:23.404625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:23.533442Z","title":"Goldshmidt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.533442Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:b4f6e1e35ad1ac13b1a17bf959eeaba3129dd511333a7d10ec329474b06ca4ac","observation_id":"5938fe8d-d88d-4ccd-acbe-2a12d5633af6","resolution":{"observed_at":"2026-08-01T19:34:23.533442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16320","last_updated":"2025-02-07T20:56:08Z","snapshot_observed_at":"2026-07-06T18:35:49.991098Z","submitted_at":"2024-06-24T05:13:19Z","title":"What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16320","snapshot_observed_at":"2026-08-01T19:34:23.641134Z","title":"Golovanevsky, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.641134Z"},"links":{"cited_paper":"/paper/2406.16320","citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:fc6315f474f91a0a8cf99d14f42bb505366cbe4b4c7149007158d0ecbec9e7eb","observation_id":"bf8d34d4-5244-45c0-b470-6d083ddf2223","resolution":{"observed_at":"2026-08-01T19:34:23.641134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:23.813763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.813763Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:ce65b959f3937cb0b04b708ff756945908955b058003eac2357cda9618763be9","observation_id":"2fdeae6f-3c67-44bc-9a3c-89d0828038e5","resolution":{"observed_at":"2026-08-01T19:34:23.813763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:23.940252Z","title":"Jocher, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:23.940252Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:08deeaa3d6b5d7476900147915ef838c0e082ff2ae67b6562c04df59cd40d938","observation_id":"097f57a4-d590-4fae-96ae-dbb98fe33bcf","resolution":{"observed_at":"2026-08-01T19:34:23.940252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:24.077883Z","title":"Gemini image generation and editing.https://deepmind.google/ technologies/gemini/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:24.077883Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:66d689c2e6c0ff8b91236a79fedba87ba3b725f3e27cd2caa390ce6340111638","observation_id":"f43ffaa2-5442-4263-ad94-5e530a4693b8","resolution":{"observed_at":"2026-08-01T19:34:24.077883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:24.216856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:24.216856Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:63b0db372158e5e6b453b83a2959a34c1e7de81430fc0bfc358f5ffa17256e2d","observation_id":"2dcd5c95-6234-4e35-a0a9-653a5ab8e6b2","resolution":{"observed_at":"2026-08-01T19:34:24.216856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:24.329428Z","title":"Palit, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:24.329428Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:3d231d8ceaa22ed9383e38c304f4509ac54067a4ec056bfdbad0a6f6dc063be0","observation_id":"c39be317-c672-49e2-ae30-f8f8c1963f8b","resolution":{"observed_at":"2026-08-01T19:34:24.329428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00328","last_updated":"2025-08-30T03:01:57Z","snapshot_observed_at":"2026-08-09T01:42:33.969493Z","submitted_at":"2025-08-30T03:01:57Z","title":"Mechanistic interpretability for steering vision-language-action models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00328","snapshot_observed_at":"2026-08-01T19:34:24.408268Z","title":"H ¨aon, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:24.408268Z"},"links":{"cited_paper":"/paper/2509.00328","citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:ff53f9527f70af7a11393620a7e324e424b61b74100ce20831e90f79295f97fd","observation_id":"54089362-2ad1-4a2c-987a-061ef16fd07d","resolution":{"observed_at":"2026-08-01T19:34:24.408268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:24.564693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:24.564693Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:65ffa7aa7c72fc8f806eac387e4a36834b0ec14bc232807569a732ac0d61c478","observation_id":"ed8baad2-d30d-4130-9197-7807a523de95","resolution":{"observed_at":"2026-08-01T19:34:24.564693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:34:24.666268Z","title":"Interpreting gpt: The logit lens.https://www.lesswrong.com/posts/ AcKRB8wDpdaN6v6ru/interpreting-gpt-the-logit-lens, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T19:34:24.666268Z"},"links":{"citing_paper":"/paper/2607.16938"},"observation_digest":"sha256:cb625450f47218d163b42ce0cb59da2e9e9fe8626532e7a2d5e2e6c523a14120","observation_id":"f8c9550c-4ca6-4858-b720-ab84305064c9","resolution":{"observed_at":"2026-08-01T19:34:24.666268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16938","last_updated":"2026-07-18T19:20:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:56:43.668622Z","submitted_at":"2026-07-18T19:20:16Z","title":"What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.16938."}