{"as_of":"2026-08-16T00:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29157ddb56e64a16a01174fb3eb6c7746dfc7aba70885d7c4d2b1df82a3b829e","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:23:14.558335Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02615/citation-record","integrity":"/paper/2506.02615/integrity","json":"/paper/2506.02615/citation-record.json","paper":"/paper/2506.02615"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:18.156415Z","title":"Spherical transformer for lidar-based 3d recognition,","venue":null,"work_id":"fc86cd4d-6b24-418a-8a78-ecd6eb3d38b6","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.510042Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:b89261e8a71704acf0e063ea39f2ff986e88bfcd047fdc695987a1c654a145ae","observation_id":"b0cbb2dd-c1e8-4c7c-8218-59c0e5f81b4c","resolution":{"observed_at":"2026-08-07T11:23:18.242083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.904726Z","title":"Rea- son2drive: Towards interpretable and chain-based reasoning for au- tonomous driving,","venue":null,"work_id":"f0f1d38d-6d5a-4c1b-976a-bf54bf5cf807","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.552518Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:060d36dda687cffc9aa08766f284494b2f8bfe8b6d1846faf10808c9c4d20fc4","observation_id":"db2325a5-b133-499e-b29b-043b829e37ba","resolution":{"observed_at":"2026-08-07T11:23:17.994358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02205","last_updated":"2024-02-07T13:09:15Z","snapshot_observed_at":"2026-08-15T13:47:16.777031Z","submitted_at":"2024-02-03T16:38:25Z","title":"GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02205","snapshot_observed_at":"2026-08-07T11:23:12.643347Z","title":"Gpt-4v as traffic assistant: an in-depth look at vision language model on complex traffic events,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.643347Z"},"links":{"cited_paper":"/paper/2402.02205","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:acf9d58f7123e13d80db00eccf532f80a76a76377e5b5599e2fd40f97eac486f","observation_id":"ebd7634f-7846-439d-a3ec-c488704bf2aa","resolution":{"observed_at":"2026-08-07T11:23:12.643347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.609614Z","title":"DriveVLM: The convergence of autonomous driving and large vision-language models,","venue":null,"work_id":"68560d45-9504-47f2-a7af-7f686d978e08","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.700488Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:3bc4394d0263b42a0e3a3cd77870b44952f1893c65a9057223c0f119d1e2806f","observation_id":"b21e0480-4d1f-4f23-b446-a5dcb535547a","resolution":{"observed_at":"2026-08-07T11:23:17.756695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.344239Z","title":"BLIP: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"23a9b292-3ed5-4832-8a30-2bed32ebc374","year":2022},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.731307Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:f73a345239ef62044da12b3ddecef3703715e938fa7bca196432f0cd50c1277e","observation_id":"a2ca9fb8-e7f4-4487-acec-05afb4933ac4","resolution":{"observed_at":"2026-08-07T11:23:17.438610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.034157Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":"e15d1130-92dd-418a-b29f-bf8088f0c6cd","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.811578Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:620431b14de977ed6ad363957afd6cab4ecdaf9777f28c08f625d6da13d6268a","observation_id":"6963edf6-5390-4462-8e3d-3c80c5aa53aa","resolution":{"observed_at":"2026-08-07T11:23:17.195480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.731855Z","title":"Jiang, A. Tagliasacchi, M. Pollefeys, and T. Funkhouser, “Openscene: 3d scene understanding with open vocab- ularies,","venue":null,"work_id":"7ab80470-9831-4ace-a18d-759186da7945","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.896521Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:de611ab012d24139f8ded781c2feb6a0a1bfc93b62b90f51c2842ce9f9e0d1f8","observation_id":"597f786b-fe0c-447d-9e0e-11ca408ee3c9","resolution":{"observed_at":"2026-08-07T11:23:16.935102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.495791Z","title":"Pla: Language-driven open-vocabulary 3d scene understanding,","venue":null,"work_id":"d016a7ed-5d71-4dac-943e-f09655146cc3","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.020546Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:7b165c605174231da88103768a779ae7bb3fb6b9b7c89a610d46e69f9925f092","observation_id":"e316f44c-cf65-42b6-8a72-d5771e19f43d","resolution":{"observed_at":"2026-08-07T11:23:16.597432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:13.119412Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.119412Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:18e53b3015e53f8ae0c8e93186788d75ba59320ba13a6b71fd5985645a69f530","observation_id":"8e082adb-b2e0-4caf-8991-74438cb51821","resolution":{"observed_at":"2026-08-07T11:23:13.119412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.181866Z","title":"The traffic scene un- derstanding and prediction based on image captioning,","venue":null,"work_id":"ad8f7c80-1765-424b-92de-5b5fecabbb04","year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.240502Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:b075fc1296d0456491f117bb54fed6f7b05d4ab21d4abc86af0928d23e9eecd5","observation_id":"0c7d06ac-d4f1-4a68-9d5a-24fd23cf89eb","resolution":{"observed_at":"2026-08-07T11:23:16.384009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.066776Z","title":"Delving into clip latent space for video anomaly recognition,","venue":null,"work_id":"2e776acb-c1d3-465f-bac5-d6be1d8cc5d9","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.339597Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:a195bfc3f82af8f0d767ada6e41349a555e78065b2a381a817bae8d806c9ef42","observation_id":"101ebe9c-9183-4f49-82aa-f422d7fb56a6","resolution":{"observed_at":"2026-08-07T11:23:16.108961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:13.482123Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.482123Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:e4446af61ba30186a7cb1a9479ac1246b65b7b0e5ee0ac93bdd4b4ffcd77b2e5","observation_id":"212ca42e-a757-42f2-ac76-e26492b69d59","resolution":{"observed_at":"2026-08-07T11:23:13.482123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-08-15T18:45:04.193943Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-07T11:23:13.595461Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.595461Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:7cc5b1ae63f127605a29de07adcbf3234cc5dd5eccc5faaf0b9d2c02b47ef941","observation_id":"08761c9a-b025-4ba5-8f76-416a3fc6726a","resolution":{"observed_at":"2026-08-07T11:23:13.595461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.967322Z","title":"Vectornet: Encoding hd maps and agent dynamics from vectorized representation,","venue":null,"work_id":"de7280fe-374b-43b5-9ab8-f47aea82d6a3","year":2020},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.727279Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:50c55503c3c7660a67fb1394252435742602b3bba17cf2ef0d18abca0d6ebc5d","observation_id":"43ab1c19-b7c8-48aa-aa60-4a48018b4346","resolution":{"observed_at":"2026-08-07T11:23:16.011931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05805","last_updated":"2021-08-12T15:37:30Z","snapshot_observed_at":"2026-08-13T18:29:34.674432Z","submitted_at":"2021-08-12T15:37:30Z","title":"Reimagining an autonomous vehicle","version":1},"cited_work":{"arxiv_id":"2108.05805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.05805","snapshot_observed_at":"2026-08-07T11:23:14.890860Z","title":"Reimagining an autonomous vehicle","venue":"cs.LG","work_id":"fde98dfc-b0ad-4616-8675-1dd08e51804f","year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.817011Z"},"links":{"cited_paper":"/paper/2108.05805","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:f02a60d50a3d94b8c34b9f17f370425bde6eada63d0a81366736ce34b4f31295","observation_id":"bfe27062-e1d8-437a-a555-578abb92c5fb","resolution":{"observed_at":"2026-08-07T11:23:14.984276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.824348Z","title":"Explainable artificial intelligence (xai): Concepts, taxonomies, opportunities and challenges toward responsible ai,","venue":null,"work_id":"42d53576-ed97-49bf-a6d6-eb9b6b00e252","year":2020},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.891608Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:5aeeca5ecff3d2ddd5b22e6015131421dad5c38d790e34a2497b5438c5a7d59f","observation_id":"a0a3c807-ec43-42a4-8d44-2a30e46a5e91","resolution":{"observed_at":"2026-08-07T11:23:15.867593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.706090Z","title":"From automation to autonomy and autonomous vehicles: Challenges and opportunities for human-computer interaction,","venue":null,"work_id":"0e3d5261-04a9-4291-a5ad-50756acc8910","year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.955573Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:21dd882c9eaa0ac2128c64fbec077343f1a8cc7c617b690a850bc34bb5d1e0a4","observation_id":"26ff000f-8917-4c67-bca6-31f7d4ad6930","resolution":{"observed_at":"2026-08-07T11:23:15.758020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03026","last_updated":"2025-04-15T03:45:30Z","snapshot_observed_at":"2026-08-13T22:49:57.954752Z","submitted_at":"2023-10-04T17:59:49Z","title":"LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03026","snapshot_observed_at":"2026-08-07T11:23:14.026613Z","title":"Languagempc: Large language models as decision makers for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.026613Z"},"links":{"cited_paper":"/paper/2310.03026","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:97b9e31142e966f3986c4463387222c6df0426eba5597cc8d084f816e09d90cb","observation_id":"fd326759-a542-4496-b394-370e4317e8fb","resolution":{"observed_at":"2026-08-07T11:23:14.026613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.554512Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":"031c7b19-758b-4630-9b92-1cde64adfcda","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.068576Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:5d7a55c8ae3521868c657d594fb7b3813b8254bf6bb6e6c78bd62f9469f639d6","observation_id":"009525c1-7108-4b0f-841b-2898fddf9f13","resolution":{"observed_at":"2026-08-07T11:23:15.644833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16292","last_updated":"2024-02-22T03:24:26Z","snapshot_observed_at":"2026-08-14T18:30:28.962974Z","submitted_at":"2023-09-28T09:41:35Z","title":"DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16292","snapshot_observed_at":"2026-08-07T11:23:14.113366Z","title":"Dilu: A knowledge-driven approach to autonomous driving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.113366Z"},"links":{"cited_paper":"/paper/2309.16292","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:ee927fa9f8fa96858bd3d43902e7e77904b78d190a4ff1ccf4c9de958052ef0f","observation_id":"439f4f6a-e764-44cf-bd1c-228f1e3b279a","resolution":{"observed_at":"2026-08-07T11:23:14.113366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.366795Z","title":"Driving with llms: Fusing object- level vector modality for explainable autonomous driving,","venue":null,"work_id":"a4eb91e6-1070-4fd9-9adb-1b1abd3da730","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.182507Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:c4fde1f86451f951d906576811d42f2372efd7ee4a2ec66c6f30cbe9fa7a5f26","observation_id":"c9dcfaf7-e65c-424a-92cf-24e977e57cb6","resolution":{"observed_at":"2026-08-07T11:23:15.445095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-08-14T07:41:23.792152Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-07T11:23:14.218939Z","title":"Gpt- driver: Learning to drive with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.218939Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:6e464360d555ee314d14dcb1110c88aa0a2be5e546c5344b9d297339652966e1","observation_id":"a06e06f1-6544-4233-b29f-5e7294f6bfdf","resolution":{"observed_at":"2026-08-07T11:23:14.218939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.317834Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.317834Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:fd2a4c38bb1fc637cc525f2156acc13ceae36839b93fcacc0b54474128b9422d","observation_id":"9bc840b0-96eb-4faf-bba9-7f50d9c1cd97","resolution":{"observed_at":"2026-08-07T11:23:14.317834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.375874Z","title":"RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Lan- guage Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.375874Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:43fc0db79ee558236586b0e08963ff88326895ea2e140a00e5db3c91168abbc9","observation_id":"f106eb8c-399d-4736-be2e-3d6bc7a9dd8d","resolution":{"observed_at":"2026-08-07T11:23:14.375874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.454649Z","title":"DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.454649Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:7b9fdcc0ebe3c66f8f2c551d8f076b03c8a2f0959cb3351bce72eb4c175df150","observation_id":"9962cfb5-f5b4-4242-9d78-35efb8d775fc","resolution":{"observed_at":"2026-08-07T11:23:14.454649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.503544Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.503544Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:61f948d273c0816f947cf777d6a925b6061324b5d9d01eda4aa2435cdeb12ae4","observation_id":"ecc36b9e-663c-4f8c-9e43-53724ef1cebb","resolution":{"observed_at":"2026-08-07T11:23:14.503544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.164006Z","title":"Lingoqa: Visual question answering for au- tonomous driving,","venue":null,"work_id":"5cddc1a3-dbec-419f-90f7-fe2453874917","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.558335Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:08888d4c5224d7fc98c1cfa3f93f943321fbeff66e1d18f62061262ff6081ab4","observation_id":"0de58213-75e5-4885-9290-f651cc754242","resolution":{"observed_at":"2026-08-07T11:23:15.227697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T16:34:52.088130Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.02615."}