{"as_of":"2026-08-14T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58992b0c3ed647a85c24c8f24a82449baa593d462db05958026df058a334d4cc","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:06:47.517274Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03568/citation-record","integrity":"/paper/2506.03568/integrity","json":"/paper/2506.03568/citation-record.json","paper":"/paper/2506.03568"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:49.073429Z","title":"Learning to drive in a day,","venue":null,"work_id":"b3353e8b-7ffe-4ab6-8a31-723401a8e3e2","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.996668Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c17d475b9a8995cd87f4bebf3c232d22eb57da620e9db3c349c63f8dd4ab089f","observation_id":"b953d159-f33d-4b89-859a-3537b2c5e1ab","resolution":{"observed_at":"2026-08-07T11:06:49.081032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-07T11:06:47.054690Z","title":"End to end learning for self-driving cars,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.054690Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:135c09452ba05349062381920a1172d50354445e23442b13540bfcba26b683ab","observation_id":"ea909278-58b2-43ac-9010-e526a626c62c","resolution":{"observed_at":"2026-08-07T11:06:47.054690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.062703Z","title":"Dense reinforcement learning for safety validation of autonomous vehicles,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.062703Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:5005fe0b3a0032c97977b8a494fc20b3e153530a2e882678cf9b9a19ada9b9da","observation_id":"26b284c1-6c32-4c92-bd57-e8d5f8d7c391","resolution":{"observed_at":"2026-08-07T11:06:47.062703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:49.007735Z","title":"A survey of deep RL and IL for autonomous driving policy learning,","venue":null,"work_id":"07e04c05-68c0-42a5-bd1f-802362ec3283","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.074645Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9181d81744a7317f8f336b1f69f3e0c21e4ca6d4403aab532b29b7d8eedf1414","observation_id":"b9599d1f-fd6d-4551-a9b6-ad054c3bd309","resolution":{"observed_at":"2026-08-07T11:06:49.016724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.987418Z","title":"A survey on autonomous vehicle control in the era of mixed-autonomy: From physics-based to ai-guided driving policy learning,","venue":null,"work_id":"5b36d9fe-8800-4ce1-820a-d70e0f48ff27","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.080690Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:07f5c9e5778fe456a5a47fb18f1d240ac4d312d2360e9d3d51976bd5da28d33f","observation_id":"a10452b6-967f-4279-b900-5e0790312f10","resolution":{"observed_at":"2026-08-07T11:06:48.994054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.087129Z","title":"Deep learning for safe autonomous driving: Current chal- lenges and future directions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.087129Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:f355fd92b568351842946a67fcee48a8cbc65709d7f71610f8b5ee04a7c0e492","observation_id":"d6c01a77-4c2a-4f80-91d0-67b85257cbb5","resolution":{"observed_at":"2026-08-07T11:06:47.087129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.092742Z","title":"Survey of deep reinforcement learning for motion planning of autonomous vehicles,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.092742Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:8b33b3bc0a6205932d93c5a41b49aa52f43c6b013a14ec109f1fe7c9788a7610","observation_id":"70e94c2b-9b6d-496f-9258-84821eaebf43","resolution":{"observed_at":"2026-08-07T11:06:47.092742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.099754Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.099754Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:44690878faadba8a221a3f547a9afdccf25169db609fe9e465d627901a31a271","observation_id":"33fc5d1f-f2a8-4f43-b19f-8a3c79b377b0","resolution":{"observed_at":"2026-08-07T11:06:47.099754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.930759Z","title":"Deep reinforcement learning for autonomous driving: A survey,","venue":null,"work_id":"3e6e721f-7562-4500-bad8-b0b074c421d7","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.108862Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:a4451721a717ce99ca0665ae95818926394c08263634f5cc1b5c460f17b195ea","observation_id":"fbac7cfb-67d7-4cd9-9adb-34ae7100f6ce","resolution":{"observed_at":"2026-08-07T11:06:48.938561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.905627Z","title":"End-to-end urban driving by imitating a reinforcement learning coach,","venue":null,"work_id":"ed3980fa-f28e-485d-80e4-b89b33ba6702","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.119541Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:d76f2c3e30d60b216b0dbf0068982ecfcf4cacb4f72026e6f4378d51c17708f7","observation_id":"2a382cf7-ee65-43e4-a623-303b4ec4c4fa","resolution":{"observed_at":"2026-08-07T11:06:48.913663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.875926Z","title":"Reward misdesign for autonomous driving,","venue":null,"work_id":"3acfa2e1-0a13-4fc5-9698-82000c73103e","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.129878Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9c3dcc42032d567b2182ba979d0368b90a084c042aaee95b74d71a6fb625a4ba","observation_id":"69b0d92e-7f70-4794-a84a-fc54ae364c6a","resolution":{"observed_at":"2026-08-07T11:06:48.887744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T11:06:47.141529Z","title":"Scalable agent alignment via reward modeling: A research direction. arxiv 2018,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.141529Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:1d56d7c6bf656816676551139e5d0eac927b234c1999319d4df8bc0c49966d4e","observation_id":"5d2bb129-4ecb-4225-92d3-85b487ae0178","resolution":{"observed_at":"2026-08-07T11:06:47.141529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13295","last_updated":"2025-08-27T11:15:11Z","snapshot_observed_at":"2026-08-07T18:07:08.742124Z","submitted_at":"2025-02-18T21:32:24Z","title":"Demonstrating specification gaming in reasoning models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13295","snapshot_observed_at":"2026-08-07T11:06:47.152726Z","title":"Demonstrating spec- ification gaming in reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.152726Z"},"links":{"cited_paper":"/paper/2502.13295","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:0fc08f987445b5c9125a0db28ebead701892e2407add03df4823fd5dcad290d5","observation_id":"c5789285-6345-42fd-8fa0-d698171dc58a","resolution":{"observed_at":"2026-08-07T11:06:47.152726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.854186Z","title":"Toward human-in-the-loop AI: Enhancing deep reinforcement learning via real-time human guidance for autonomous driving,","venue":null,"work_id":"743dd9ed-9140-482d-8000-071492ad2092","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.159984Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:e69c98cb35f92530eb34affc9d1188c4ea51b2244f6a0de426ed92c64fabff22","observation_id":"3ecdb816-979a-4115-8595-9a98158cc2fd","resolution":{"observed_at":"2026-08-07T11:06:48.861260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.834767Z","title":"Hindsight credit assignment,","venue":null,"work_id":"dc00d699-3807-4b65-8478-382aad998703","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.176862Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:bed102177882d7f1878d2037a82d8ec31e6d6ac98df928eec2f39b3b01e23b10","observation_id":"e200d637-9a49-4c9b-bcf8-f7d3425a8012","resolution":{"observed_at":"2026-08-07T11:06:48.841270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05173","last_updated":"2017-07-17T14:13:40Z","snapshot_observed_at":"2026-08-10T07:32:08.005033Z","submitted_at":"2017-07-17T14:13:40Z","title":"Trial without Error: Towards Safe Reinforcement Learning via Human Intervention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05173","snapshot_observed_at":"2026-08-07T11:06:47.203825Z","title":"Trial without error: Towards safe reinforcement learning via human intervention,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.203825Z"},"links":{"cited_paper":"/paper/1707.05173","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:0b422112a64b009a1b073b42bd243bc891f6fdb2c70a9acb96a108012f77c764","observation_id":"37afddd2-4f33-41ff-8d6a-2707ab0e72bc","resolution":{"observed_at":"2026-08-07T11:06:47.203825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.813298Z","title":"A survey on imitation learning techniques for end-to-end autonomous vehicles,","venue":null,"work_id":"3dca44b4-fe25-45f5-82e1-0dfc7d2c2903","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.211989Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c3c9fd5725460bbab147c04efb06266bea8b37404606760f7383cf133bfbb1ae","observation_id":"7435c22e-26b8-487a-b920-9a468755d7a3","resolution":{"observed_at":"2026-08-07T11:06:48.820149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.777646Z","title":"Conditional predictive behavior planning with inverse reinforcement learning for human-like autonomous driving,","venue":null,"work_id":"432ff650-d308-438a-8750-e08755436a0d","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.224555Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:5d79b77d6f3afed7701a9b6e2ee0db7518491f1418e62dad532333899022babc","observation_id":"43b0205f-a0b0-4a5c-84ba-28463da293fb","resolution":{"observed_at":"2026-08-07T11:06:48.790007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.739988Z","title":"Pattern recognition and adaptive control,","venue":null,"work_id":"b440c3c5-6d5d-42b7-8f59-0d1488b0a2aa","year":1964},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.230363Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:00305a8cc7fa7b9ff025476fa43f3afe72f1b791df118786b955943bff6ea858","observation_id":"52d91390-1107-4988-9158-bdb23e1d15f6","resolution":{"observed_at":"2026-08-07T11:06:48.747424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06711","last_updated":"2018-11-16T09:06:54Z","snapshot_observed_at":"2026-08-11T05:22:39.008372Z","submitted_at":"2018-11-16T09:06:54Z","title":"An Algorithmic Perspective on Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06711","snapshot_observed_at":"2026-08-07T11:06:47.235938Z","title":"An algorithmic perspective on imitation learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.235938Z"},"links":{"cited_paper":"/paper/1811.06711","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:5967683572c6078306c6ccdc150271e63eb342076e151943cec498dd6b0987a2","observation_id":"a4696d27-913a-475b-a557-d457f26f83c7","resolution":{"observed_at":"2026-08-07T11:06:47.235938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.719632Z","title":"Learning a decision module by imitating driver’s control behaviors,","venue":null,"work_id":"df618f5d-d346-4fee-bfbe-3515ef32ee8b","year":2020},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.242273Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:a7bf260d5ba30cd3c1546d67a5a820e2328f25b416db4e518d9c5d06c4e7530f","observation_id":"2f971b72-1e49-456d-8b9a-ff91feb8d2ef","resolution":{"observed_at":"2026-08-07T11:06:48.726411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14497","last_updated":"2021-04-26T17:38:23Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:54:25Z","title":"Conservative Safety Critics for Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14497","snapshot_observed_at":"2026-08-07T11:06:47.251327Z","title":"Conservative safety critics for exploration,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.251327Z"},"links":{"cited_paper":"/paper/2010.14497","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:ca46a104a915d79aece741e89b163d0b2d8af3fd8b8bc58eba84deab9a33748e","observation_id":"33693b59-16e0-45ff-8b2c-7ff49c725d71","resolution":{"observed_at":"2026-08-07T11:06:47.251327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T11:06:47.259634Z","title":"Behavior regularized offline reinforcement learning,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.259634Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:0e7b81580bd69ace1f925cbc15a13fca450d4b45310dd319dceb4587eacfdcd2","observation_id":"9ab2d0dd-d2b1-4721-b75a-7bfb2264ad49","resolution":{"observed_at":"2026-08-07T11:06:47.259634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.698071Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"9588f1ff-1383-416b-a839-9b838ae67476","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.267759Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:bac883946abd7c53b0230419e6e12cd6ca3fad33bc91903cc5538ab003e9f306","observation_id":"7e335325-1715-4ac0-a391-11f2cc86de03","resolution":{"observed_at":"2026-08-07T11:06:48.703985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.667981Z","title":"Adversarial inverse rein- forcement learning with self-attention dynamics model,","venue":null,"work_id":"3b9cc6f7-298d-4539-893a-f51504f75767","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.274511Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2ac4f754180a90f5283d8dd28710b9375c9423c9d08da097bdf53be59fe8000b","observation_id":"0098b27e-2e4b-42a2-a36d-324d9d0fd4e7","resolution":{"observed_at":"2026-08-07T11:06:48.675772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.641108Z","title":"Efficient reductions for imitation learning,","venue":null,"work_id":"1918ef2e-f1e7-41d4-9ea2-eb15fa9f0144","year":2010},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.301201Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:e25e4108c644a2c9217e047f61ac0db73784f78e89c955e3852876f15a191d00","observation_id":"9434015b-8421-4144-b37f-18da759de9d6","resolution":{"observed_at":"2026-08-07T11:06:48.648437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.613972Z","title":"Exploring the limi- tations of behavior cloning for autonomous driving,","venue":null,"work_id":"e5ae480e-d9cf-46db-a463-de24b761069f","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.314152Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:4ae41ab09d51f89561f7b686db833a7aaa78b262181bbe3176073dac5d46c42a","observation_id":"4442ef43-f0c1-432b-9059-456c2821fa2c","resolution":{"observed_at":"2026-08-07T11:06:48.625527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.583762Z","title":"Behavioral cloning a correction,","venue":null,"work_id":"1d470922-a6e7-4f12-af27-a6b98164da6f","year":1995},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.320883Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:706ccecae23f87b452b5cb05a7d6b224c58382eaaf3698f36f4d9352c66a7d65","observation_id":"6bf27769-625a-48d1-ab28-945048db412f","resolution":{"observed_at":"2026-08-07T11:06:48.590978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.549120Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play,","venue":null,"work_id":"52d107f5-d7db-41aa-9a2f-e96e22d57f12","year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.328632Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:3e98d4deb8be0a5444071f60c139c56bc0a5b432c78a76fb20436f9c838bd8a0","observation_id":"ec8175b5-24a6-42d4-bdcc-c042ea77d078","resolution":{"observed_at":"2026-08-07T11:06:48.561472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.525863Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning,","venue":null,"work_id":"34e3834f-27db-4f0d-9508-7a9ac65754be","year":2011},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.335160Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:e5735d37a5645b88ffe39c84d3756ae87de37369559401ed7d1bf7c3ca1b6315","observation_id":"024cbaec-61db-4023-908b-e53548811411","resolution":{"observed_at":"2026-08-07T11:06:48.533279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06450","last_updated":"2016-05-20T17:40:16Z","snapshot_observed_at":"2026-07-06T04:57:02.729338Z","submitted_at":"2016-05-20T17:40:16Z","title":"Query-Efficient Imitation Learning for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.06450","snapshot_observed_at":"2026-08-07T11:06:47.345392Z","title":"Query-efficient imitation learning for end-to-end autonomous driving,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.345392Z"},"links":{"cited_paper":"/paper/1605.06450","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:4c441d49da8c6d5872191d41a0d08b6791b14a21a259c44c2d380997364e1512","observation_id":"f1763acf-d4a0-4831-a456-b69e1506e204","resolution":{"observed_at":"2026-08-07T11:06:47.345392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.354950Z","title":"Hg-dagger: Interactive imitation learning with human experts,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.354950Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:64a69a3379de7570945a17a712be1a3bb21508c5b0dba7ef16e56a25af61d0a9","observation_id":"70cfac0c-e7e9-4dfc-a259-3032037c6108","resolution":{"observed_at":"2026-08-07T11:06:47.354950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.481572Z","title":"Thriftydagger: Budget-aware novelty and risk gating for interactive imitation learning,","venue":null,"work_id":"9c3d9e8a-82d3-459f-9682-9d2ac336908a","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.379002Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:bf80411b12460afd7ec541e0988fc1b69ea8dcf522215c516d44668b777a9516","observation_id":"8d0258af-51c5-4dba-a66c-2a63b26941c0","resolution":{"observed_at":"2026-08-07T11:06:48.489799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.455265Z","title":"Expert intervention learning,","venue":null,"work_id":"526cb14f-9be9-4ff7-b6f6-7b826be2fddd","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.384324Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:6eea4758821433d3d8ace512daa1368d6c9485b5c3fdba6565ec2d5a9d54dd67","observation_id":"9a20d808-d509-43e5-b925-2926ac9b8c0d","resolution":{"observed_at":"2026-08-07T11:06:48.467741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06733","last_updated":"2020-12-12T05:30:35Z","snapshot_observed_at":"2026-08-13T20:47:23.906756Z","submitted_at":"2020-12-12T05:30:35Z","title":"Human-in-the-Loop Imitation Learning using Remote Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06733","snapshot_observed_at":"2026-08-07T11:06:47.390201Z","title":"Human-in-the-loop imitation learning using remote tele- operation,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.390201Z"},"links":{"cited_paper":"/paper/2012.06733","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2dcb081e7518761b42b3c7d114cf7148a4432ef3d7944262d1600d1fbb11e5c7","observation_id":"93b1d758-f991-4c18-92d1-157a51a2a22b","resolution":{"observed_at":"2026-08-07T11:06:47.390201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.427202Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":"bcc3097b-f2ee-4668-a49a-ebff5d50c7db","year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.398761Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:ef6ce44ab5e71857ea5b99c0f13e522bfe73065bf0d9dbf6c13ea3b8a260f5e4","observation_id":"5cc54a30-2cf5-4e27-bca1-c6b64468a705","resolution":{"observed_at":"2026-08-07T11:06:48.434427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.399860Z","title":"Batch active preference-based learning of reward functions,","venue":null,"work_id":"a1c49309-11bd-44c6-a6f1-09a4b130f300","year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.404330Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:f959017730b2f7ec1bc63b4c718cab0a4d083983af73c756358abf1ca3a6e169","observation_id":"558d2604-d8a2-45cd-96b4-1858083f53f1","resolution":{"observed_at":"2026-08-07T11:06:48.407579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08928","last_updated":"2019-06-21T03:00:36Z","snapshot_observed_at":"2026-08-02T22:07:19.765753Z","submitted_at":"2019-06-21T03:00:36Z","title":"Learning Reward Functions by Integrating Human Demonstrations and Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08928","snapshot_observed_at":"2026-08-07T11:06:47.410249Z","title":"Learning reward functions by integrating human demonstrations and preferences,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.410249Z"},"links":{"cited_paper":"/paper/1906.08928","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c0e90d7f3d47d86892c7df89d1618eef7925ad19cbac3579c72d106e15926cd3","observation_id":"64f9f942-7044-4d1b-b85d-3446d11595d6","resolution":{"observed_at":"2026-08-07T11:06:47.410249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.371225Z","title":"Efficient learning of safe driving policy via human-AI copilot optimization,","venue":null,"work_id":"0d07c085-f337-4a25-a878-dc89824bba10","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.416144Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:afeaa8eed94157f8d6001ebf2eb69993cd88a89eb3846f949e0ebb19a6db7681","observation_id":"67e09e0c-5b81-46f2-8a1d-49f877c648b0","resolution":{"observed_at":"2026-08-07T11:06:48.378955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.345350Z","title":"Learning from active human involvement through proxy value propagation,","venue":null,"work_id":"0ef8e79c-b689-4a45-b627-6d44931f2688","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.421979Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2897f7bf8ed9adc530d048495cc8a37b40285620c833f27b12f9f3d89d0ea3ea","observation_id":"67936181-90d0-495a-866a-28f330be8d8c","resolution":{"observed_at":"2026-08-07T11:06:48.353963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-08-14T00:30:45.171423Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-07T11:06:47.427864Z","title":"Meta-world: A benchmark and evaluation for multi- task and meta reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.427864Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:5d7d64ffe04b8d5f0106d0861383c93ae94d6ccd0fbe021c920d92071820bcf5","observation_id":"ace12819-7be9-4dbb-8251-53a121e283b2","resolution":{"observed_at":"2026-08-07T11:06:47.427864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.324985Z","title":"Socially situated artificial intelligence enables learning from human interaction,","venue":null,"work_id":"0a2e328f-13fd-484c-a762-4e0297039478","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.433857Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:564335ee36a7f8aa12481a0dad1b153a60a4c4e4a433f4467b379dad357183a6","observation_id":"355d23c3-b0f1-4007-80e5-e2862f3e8c3b","resolution":{"observed_at":"2026-08-07T11:06:48.332758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.291735Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"1a2362a6-635d-4121-8fdf-6b7a1883034c","year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.439626Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:f4a1e2c3657c61db57e7740628064416cd82d8a1a64e3349d40f8e87323ab8a1","observation_id":"268b589d-5665-465a-8013-6846a2e03e11","resolution":{"observed_at":"2026-08-07T11:06:48.301583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.252913Z","title":"Human as AI mentor: Enhanced human-in-the-loop reinforcement learning for safe and effi- cient autonomous driving,","venue":null,"work_id":"cbcf073d-11f9-4810-8c66-e1426ba2f0bb","year":2024},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.446612Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:3a60fd7a0231066cf17d1b36dcd879da068f56357e9a27ffa89c954a1e46f64d","observation_id":"09d7c262-872f-4a76-b8bb-ab18800494a0","resolution":{"observed_at":"2026-08-07T11:06:48.271114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.226513Z","title":"Guarded policy optimization with imperfect online demonstrations,","venue":null,"work_id":"aad2bf1d-e6ab-45f3-94c0-dc1e2cec9e81","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.451753Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:ae06b5ba2b4aa443524ed4184c7e4ef1fbf46617faa823af58c48e2bac145410","observation_id":"dd045378-b146-4e55-9cf1-b5559197a214","resolution":{"observed_at":"2026-08-07T11:06:48.234155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.197640Z","title":"Trust region policy optimization,","venue":null,"work_id":"7f9370e3-f99d-4f32-885b-7ba6cba710b6","year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.457418Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:ce885b1d5f8e8b51b5b7983ceec2d8f212a5b525505556b2372d8ae925027ff5","observation_id":"d56724d3-6b63-4773-84a8-f20f074ef99b","resolution":{"observed_at":"2026-08-07T11:06:48.209925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.168947Z","title":"Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning,","venue":null,"work_id":"c35b0109-3509-47f3-bfe1-0d14ea6d517f","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.462594Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c397c4619fa1fc2bff89917ae7437ed84273bf002d54c4bf4846c991e6c109cf","observation_id":"fbc2e929-024c-40ff-8841-12f2dfc434be","resolution":{"observed_at":"2026-08-07T11:06:48.176999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.143468Z","title":"Responsive safety in reinforce- ment learning by pid lagrangian methods,","venue":null,"work_id":"4e371576-3ebc-492e-aab2-2c3c2f7b8bce","year":2020},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.468686Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2043b877b4dceb4eb360c3ae01c3b1f260fe64a7c4b07e7f53d22d874227140a","observation_id":"b46c8c8a-366e-447a-bee1-d91116c5d1d4","resolution":{"observed_at":"2026-08-07T11:06:48.150462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08550","last_updated":"2020-11-03T05:46:51Z","snapshot_observed_at":"2026-08-10T20:40:57.457282Z","submitted_at":"2020-02-20T03:36:39Z","title":"Learning to Walk in the Real World with Minimal Human Effort","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08550","snapshot_observed_at":"2026-08-07T11:06:47.474001Z","title":"Learning to walk in the real world with minimal human effort,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.474001Z"},"links":{"cited_paper":"/paper/2002.08550","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:74e66af3cfd367dbb0449ba8cdf0fb3286770ada505b114bc1a3b3713d6f0929","observation_id":"8d55fd2c-4562-4271-8430-f18d391150b2","resolution":{"observed_at":"2026-08-07T11:06:47.474001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.113722Z","title":"Conservative Q- learning for offline reinforcement learning,","venue":null,"work_id":"8ebf8522-962a-445e-8ba1-3394e90f748b","year":2020},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.479725Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:26e2c5e556e102f4eebbc3eee412ba75e8e81eaa630f2f2e2c023e860691d5f9","observation_id":"f771110b-c8bf-4dda-8076-11d34b2454a5","resolution":{"observed_at":"2026-08-07T11:06:48.125073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:06:47.485274Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.485274Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:aa5fe42cfec373d8f6cb59abbd6f8e61defa01514e7626360b4a31f183c05f04","observation_id":"2b598292-45f2-4e28-9d94-55dfe16f77f7","resolution":{"observed_at":"2026-08-07T11:06:47.485274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.078340Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors,","venue":null,"work_id":"41345775-4eda-44b8-9c9c-2773a413fbc6","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.497444Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c209cc520cb7f4ccbc967157ccc6d43a77c6df4661baaf133478fdb8ddd2d600","observation_id":"389de93b-200b-4f6b-aa22-ce32ef49726e","resolution":{"observed_at":"2026-08-07T11:06:48.085564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.052859Z","title":"A framework for behavioural cloning,","venue":null,"work_id":"f644c4ed-a5de-425d-a582-132e1fc39bd4","year":1999},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.504779Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c0b44a13ee23ad08c738d35da47abd0af14f186955b6614068b9f0446f4c2da8","observation_id":"0b2a3f9b-c5c4-4ba3-8bb6-24d538ca433f","resolution":{"observed_at":"2026-08-07T11:06:48.059247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.026368Z","title":"Generative adversarial imitation learning,","venue":null,"work_id":"9c163fe9-47db-4529-96b5-1448acd805ce","year":2016},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.511187Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:c4124b634116c3d6b3ae62521e7010d067627c79f74fb6271dcdf1823e61de2d","observation_id":"ee91778d-321a-480a-a9dd-e402f4b66a43","resolution":{"observed_at":"2026-08-07T11:06:48.037949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.985279Z","title":null,"venue":null,"work_id":"d8ccf6b7-efa0-44a4-a134-381ae31e347f","year":null},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.517274Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:0f8e561270d654ceb45d3d307eb1770fc26410d4fa33633e685e7105cbfa862b","observation_id":"ec87f5b9-e218-4ec9-9066-043b308dffc2","resolution":{"observed_at":"2026-08-07T11:06:47.999906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T01:57:17.582704Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2506.03568."}