{"as_of":"2026-08-10T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ded7dbafdf1eb0870df102db600331bf5a1595148fa6eaa83ed8d084a2deb99","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:41:31.838029Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:27:24.257956Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T08:36:59.779636Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T12:48:32.123998Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2509.24948"},"observation_digest":"sha256:ef186eb9c77ca67d664fa2df08f8f83523955559650d0c81079906fe8a26a3fd","observation_id":"0bf917a1-ce2c-4b1c-9be6-5d5b4f46a41b","resolution":{"observed_at":"2026-05-18T12:51:23.519299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T02:35:13.126171Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2511.00088"},"observation_digest":"sha256:c764efe3f2dc723fff3c5f07447e57586b37056df68cddcaf9cf7ee72818f665","observation_id":"b8797e64-ab29-46c2-9fbb-9996a361131f","resolution":{"observed_at":"2026-05-18T02:35:13.275712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:3dd02627af4a961b2095399fc803bbad415c0a0c51bb4d9ab8cfe10cce29f0e3","observation_id":"b1fde534-10ca-400a-bfb6-388f62c45197","resolution":{"observed_at":"2026-05-17T06:29:09.833895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2512.10226","last_updated":"2026-04-14T00:44:42Z","snapshot_observed_at":"2026-08-02T07:00:45.391301Z","submitted_at":"2025-12-11T02:22:07Z","title":"Latent Chain-of-Thought World Modeling for End-to-End Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T23:16:41.916869Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2512.10226"},"observation_digest":"sha256:29bc585ec3f17a975b2f483488653b8189f113ef79220d7c4be95759d3bc61bf","observation_id":"bba8b92a-e0e6-496f-b302-b97ab1d846c4","resolution":{"observed_at":"2026-05-16T23:18:39.859691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-08-03T16:27:24.257956Z","title":"Irl-vla: Training an vision-language- action policy via reward world model.arXiv preprint arXiv:2508.06571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13636","last_updated":"2026-07-17T07:01:14Z","snapshot_observed_at":"2026-08-04T13:44:30.220787Z","submitted_at":"2025-12-15T18:31:32Z","title":"MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:24.257956Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2512.13636"},"observation_digest":"sha256:0c7f0728787855bab731aa8bf2385a014e655330d466aae6736c0fcbcc2da6d4","observation_id":"78427e88-2f27-4152-ac07-e3e37463355d","resolution":{"observed_at":"2026-08-03T16:27:24.257956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:2c357ad27c9a0af1bade84715cfedc682e77a2e2d4754ef2d80caca9b487aed6","observation_id":"cc3c1ee7-953f-4aaa-a642-ed20e715d474","resolution":{"observed_at":"2026-05-10T14:10:29.734642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:5a0e66e82698357333ae01047b0599aa9e84a73ba97e7d4e8ce8aad4c7b28d5c","observation_id":"726b3100-d940-45dd-bc8e-612e43ff0621","resolution":{"observed_at":"2026-05-10T08:12:26.263488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2604.19710","last_updated":"2026-04-21T17:34:19Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:34:19Z","title":"SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:34:29.624029Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2604.19710"},"observation_digest":"sha256:bcd14764c1a87892cac8ad95f3448ad7c8c023cd1bddc7e93e4bbdcafa8e0652","observation_id":"906c2d25-f002-4967-b119-fad978051e4b","resolution":{"observed_at":"2026-05-11T12:56:10.808364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.08975","last_updated":"2026-05-09T14:34:00Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T14:34:00Z","title":"Latency Analysis and Optimization of Alpamayo 1 via Efficient Trajectory Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:52:02.233177Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.08975"},"observation_digest":"sha256:308ee248f6eb816996c10975b784e2f6e35eed9c771cdd4fcc2783f213b6d7e2","observation_id":"6140c01f-3951-42f6-806c-f72b4e4d7bb9","resolution":{"observed_at":"2026-05-12T07:46:50.857406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.21139","last_updated":"2026-05-22T01:55:27Z","snapshot_observed_at":"2026-08-08T20:19:01.862390Z","submitted_at":"2026-05-20T13:14:28Z","title":"Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T04:44:48.349384Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.21139"},"observation_digest":"sha256:fedaa96c811156dd420124b4b58d7bb002753d3fbd84d1f3c053feba06c8a260","observation_id":"a9519e4e-7fde-4811-a07e-b7089c25c52e","resolution":{"observed_at":"2026-05-21T04:49:35.792564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.21139","last_updated":"2026-05-22T01:55:27Z","snapshot_observed_at":"2026-08-08T20:19:01.862390Z","submitted_at":"2026-05-20T13:14:28Z","title":"Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:10.143179Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.21139"},"observation_digest":"sha256:90b1527db2c2eb1d9a2286f96296fbae8ffa0e800ccd7eda2120d10865f84713","observation_id":"b49abf41-3de4-495c-973f-050d5cf5a7f8","resolution":{"observed_at":"2026-05-25T05:55:24.815699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.31116","last_updated":"2026-05-29T10:27:32Z","snapshot_observed_at":"2026-08-02T02:51:10.320818Z","submitted_at":"2026-05-29T10:27:32Z","title":"NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T22:57:01.742536Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.31116"},"observation_digest":"sha256:f0afca5d9a00a113dd7ced4d66110bb984a2de57ce2a4da9096c7029a2be1f3a","observation_id":"0e8534ad-08b3-4702-9e8b-cbba6dfdff07","resolution":{"observed_at":"2026-06-28T23:02:46.926168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2605.31476","last_updated":"2026-05-29T16:05:42Z","snapshot_observed_at":"2026-08-07T03:01:35.395589Z","submitted_at":"2026-05-29T16:05:42Z","title":"IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T22:23:07.223613Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2605.31476"},"observation_digest":"sha256:b796836d6dbfdef72c2b7113ac25cf1d69fdc106f592627d4b9509cd3e6d2fee","observation_id":"b00599c5-6f3f-430f-bbc2-6a4f40027e71","resolution":{"observed_at":"2026-07-01T19:36:08.476569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2606.00113","last_updated":"2026-05-27T05:32:17Z","snapshot_observed_at":"2026-08-01T09:58:43.654749Z","submitted_at":"2026-05-27T05:32:17Z","title":"World Models for Robotic Manipulation: A Survey","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-06-29T12:24:18.025364Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2606.00113"},"observation_digest":"sha256:d04ca6f8dc828bd36e939a5ca2bfedc5c02e5086cde97ec50a80b27e90c50bb6","observation_id":"ceaf1399-6b15-4a6f-9991-67721a9a07c6","resolution":{"observed_at":"2026-06-29T12:33:25.078010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2606.05645","last_updated":"2026-06-09T07:25:40Z","snapshot_observed_at":"2026-07-06T23:45:37.713710Z","submitted_at":"2026-06-04T03:16:31Z","title":"Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T01:49:25.510681Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2606.05645"},"observation_digest":"sha256:ff43ea0335dc483382e09fa30ee60754f69eaa7fc44a50cb874dbfaa91fa3350","observation_id":"860069f4-8aa2-41d2-9a69-2b774bdb3957","resolution":{"observed_at":"2026-07-02T12:46:57.089281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2606.19836","last_updated":"2026-06-18T06:28:33Z","snapshot_observed_at":"2026-08-09T14:20:30.306075Z","submitted_at":"2026-06-18T06:28:33Z","title":"World Engine: Towards the Era of Post-Training for Autonomous Driving","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-26T17:21:15.456982Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2606.19836"},"observation_digest":"sha256:be5658ce84444e93304a278ae5b68a7442dc00dbb465b8d48a13c1fa4f2a343e","observation_id":"673c745e-6bdb-452c-9c15-9afbabf66cdb","resolution":{"observed_at":"2026-07-04T03:59:33.870818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2607.08072","last_updated":"2026-07-13T20:41:06Z","snapshot_observed_at":"2026-08-08T04:10:52.463777Z","submitted_at":"2026-07-09T03:00:47Z","title":"Post-Training in End-to-End Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T00:42:28.701843Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2607.08072"},"observation_digest":"sha256:74ee724ffb8d0d02ab08ffd058c20d2334fa11a2e3c775ff40bbfdfb85baa3de","observation_id":"5a592479-c7e2-440b-bb5b-c89a8e3a29bf","resolution":{"observed_at":"2026-07-10T00:46:40.298575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"cited_work":{"arxiv_id":"2508.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06571","snapshot_observed_at":"2026-07-10T08:36:59.779636Z","title":"Irl-vla: Training an vision-language-action policy via reward world model","venue":"cs.AI","work_id":"949851a8-6409-4b4c-8066-025f27808795","year":2025},"citing_paper":{"arxiv_id":"2607.08375","last_updated":"2026-07-09T11:49:57Z","snapshot_observed_at":"2026-08-01T14:34:54.273695Z","submitted_at":"2026-07-09T11:49:57Z","title":"WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T08:30:29.351159Z"},"links":{"cited_paper":"/paper/2508.06571","citing_paper":"/paper/2607.08375"},"observation_digest":"sha256:daa1a65788614e9a65a0358e45a047bacb1a263188fefb9087fbda4daf7e10ce","observation_id":"29aca45e-edf5-4daa-8fdf-06915c8773ba","resolution":{"observed_at":"2026-07-10T08:36:59.781035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06571/citation-record","integrity":"/paper/2508.06571/integrity","json":"/paper/2508.06571/citation-record.json","paper":"/paper/2508.06571"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T23:41:31.725595Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.725595Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:7b0e406866dc8a74e0aee03a9c4f770cae8373559486b827ecc68d77eb4527ba","observation_id":"19a43edb-9e70-49d0-8bd3-e205ac0bd3a0","resolution":{"observed_at":"2026-08-05T23:41:31.725595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.346182Z","title":"Training diffusion models with reinforcement learning, 2024","venue":null,"work_id":"8a535172-db9a-4fde-ba9f-be91693ea488","year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.731882Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:4e289d25e7ac15cd4bd19a54e625b66d444f8c159738a5bd7240e27e9ba5c693","observation_id":"73b426f7-a4dc-4022-a6de-0d63445c8c70","resolution":{"observed_at":"2026-08-05T23:41:32.349252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.736375Z","title":"Pseudo- simulation for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.736375Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:5a8c009f5a5692731f4d7109968e9a30b2e254ac7bb892d8cbfc93637f370d8c","observation_id":"10117937-04c5-4fdc-a9e3-327b56b8ff8a","resolution":{"observed_at":"2026-08-05T23:41:31.736375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.336749Z","title":"Transfuser: Imitation with transformer-based sensor fusion for au- tonomous driving","venue":null,"work_id":"b0336ff7-75b7-49f3-8981-21fe09434f95","year":null},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.740137Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:275b69f9d037e916830a3d8651fd6a15cfa4d511d9268ae977373b94b5f40a70","observation_id":"12831453-a6e2-4209-8fce-de07c480d253","resolution":{"observed_at":"2026-08-05T23:41:32.339969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.327882Z","title":"Parting with misconceptions about learning-based vehicle motion planning","venue":null,"work_id":"683a1b5e-15e9-423b-9ca6-f14fbe968d96","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.743912Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:8bcca7f9a31223f93ccd763ed265ba4dae22c18ab8d1ee3f8ef623094b96eff0","observation_id":"1c3578b4-b05c-4f19-97c9-5a75c2cb28ba","resolution":{"observed_at":"2026-08-05T23:41:32.330769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.318510Z","title":"Navsim: Data-driven non-reactive autonomous vehicle simulation and benchmarking","venue":null,"work_id":"146e978b-72f4-4aec-a397-38876f9fe9e9","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.747756Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:04a86575c9f1d776777a5dc019bea0800396b02aa0051fa8b3fbf2112859ee8f","observation_id":"e3db77b6-c139-4555-9b31-0fb3986738a0","resolution":{"observed_at":"2026-08-05T23:41:32.321930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19755","last_updated":"2025-03-25T15:18:43Z","snapshot_observed_at":"2026-08-05T21:57:39.132989Z","submitted_at":"2025-03-25T15:18:43Z","title":"ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19755","snapshot_observed_at":"2026-08-05T23:41:31.751498Z","title":"Orion: A holistic end-to-end autonomous driving framework by vision-language instructed action gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.751498Z"},"links":{"cited_paper":"/paper/2503.19755","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:a3ef06a4a2e922cdc2af4e8c2cebcf3b1ee3e5e4e3bc435dc8277662fa05003f","observation_id":"6bc197cc-12e3-47c6-bc39-60c10520e2c1","resolution":{"observed_at":"2026-08-05T23:41:31.751498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.755666Z","title":"Rad: Training an end-to-end driving policy via large-scale 3dgs-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.755666Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:621c7114514a40b959fa3d9a45417b821d18481ed1694696b40a8427ebeb8f06","observation_id":"be38b2d6-bcb0-4ed9-94cd-b5159061e992","resolution":{"observed_at":"2026-08-05T23:41:31.755666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:41:31.759015Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.759015Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:b5463a42b0a096918c53c808bf2ed2449e38125e524bbb5bbceb5e1a0ab9c7da","observation_id":"48f5bac0-284e-4315-9f00-8a476dcdee68","resolution":{"observed_at":"2026-08-05T23:41:31.759015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.309136Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"59f8642c-5d5b-46d6-b455-064a8f787e11","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.762813Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:fa18285c793dd48a6a8a4f107b61d45623dcca6f925e8965bdf24a2984f95baa","observation_id":"fb25938f-71dc-4de2-8767-58b5d5feba6a","resolution":{"observed_at":"2026-08-05T23:41:32.312110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-05T23:41:31.766176Z","title":"Emma: End-to- end multimodal model for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.766176Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:f7b5021ecea468b43be5beb7af6d07bc96afeb8970cbe2ee5cd483d8b7855f14","observation_id":"9a9efb1e-292e-48fb-8693-635745dd3494","resolution":{"observed_at":"2026-08-05T23:41:31.766176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-05T23:41:31.769794Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.769794Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:1e7e341f39f36adcb6e7ae25f10c1ce0051b66c99202ff4c397bb7c0fda9d618","observation_id":"e9227cc0-15a1-4ff1-b4f9-4abff732a5c1","resolution":{"observed_at":"2026-08-05T23:41:31.769794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19381","last_updated":"2025-06-03T02:28:31Z","snapshot_observed_at":"2026-08-07T14:12:57.110186Z","submitted_at":"2025-05-26T00:49:35Z","title":"DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19381","snapshot_observed_at":"2026-08-05T23:41:31.774080Z","title":"Diffvla: Vision-language guided diffusion planning for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.774080Z"},"links":{"cited_paper":"/paper/2505.19381","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:19f739a58d1bae15b8274819b3bf4bc5a24550346f40ccc88c94dcab9d9e81bb","observation_id":"539c03c9-b0de-49b4-acd6-2035043bae97","resolution":{"observed_at":"2026-08-05T23:41:31.774080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-05T23:41:31.777980Z","title":"Senna: Bridging large vision- language models and end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.777980Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:e85a0ae433de885399a8f879f1d10319117e13b5b908722472df0844bc698717","observation_id":"213b3c2c-5e5c-4467-bafe-94ad9546f0c9","resolution":{"observed_at":"2026-08-05T23:41:31.777980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.299821Z","title":"Vad: Vectorized scene representation for efficient autonomous driving","venue":null,"work_id":"396b2829-8f5f-4b17-a3ab-756415e3b1fc","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.781549Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:ef9c5b8be3c6db630b01cea0b5f6ff3fe003b3ace1ac107c1e48ec2c83e5ec54","observation_id":"1ff95cbe-0d21-43ac-b262-001535e5e840","resolution":{"observed_at":"2026-08-05T23:41:32.303150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01941","last_updated":"2025-04-09T12:01:43Z","snapshot_observed_at":"2026-08-07T16:13:51.725618Z","submitted_at":"2025-04-02T17:47:23Z","title":"End-to-End Driving with Online Trajectory Evaluation via BEV World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01941","snapshot_observed_at":"2026-08-05T23:41:31.785006Z","title":"End-to-end driving with online trajectory evaluation via bev world model.arXiv preprint arXiv:2504.01941, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.785006Z"},"links":{"cited_paper":"/paper/2504.01941","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:39e096494df48047270d023ed75c88ae98a2c27e0d4b324c5f242ec4eb7e9ad4","observation_id":"230a0b04-8927-41b3-9e69-ca7de315e0e4","resolution":{"observed_at":"2026-08-05T23:41:31.785006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08052","snapshot_observed_at":"2026-08-05T23:41:31.788746Z","title":"Recogdrive: A rein- forced cognitive framework for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.788746Z"},"links":{"cited_paper":"/paper/2506.08052","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:73acd65ba918e7652d852ca8bdced9d7e3792155b81a75e3fdb8a34a5338ee9a","observation_id":"b9d1c1f7-27d1-4edd-ae28-ea730f060092","resolution":{"observed_at":"2026-08-05T23:41:31.788746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06978","last_updated":"2024-08-30T03:37:36Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:18:26Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06978","snapshot_observed_at":"2026-08-05T23:41:31.792633Z","title":"Hydra-mdp: End-to-end multimodal planning with multi-target hydra-distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.792633Z"},"links":{"cited_paper":"/paper/2406.06978","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:754a1c85523f89d7d5cdf483bebcacda9cee0f8d3aaf709ee60171afd1309c15","observation_id":"acc7543c-7e1d-4d01-898f-e197281976e8","resolution":{"observed_at":"2026-08-05T23:41:31.792633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06664","last_updated":"2025-06-07T05:06:05Z","snapshot_observed_at":"2026-08-09T02:59:06.476082Z","submitted_at":"2025-06-07T05:06:05Z","title":"Generalized Trajectory Scoring for End-to-end Multimodal Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06664","snapshot_observed_at":"2026-08-05T23:41:31.796375Z","title":"Generalized tra- jectory scoring for end-to-end multimodal planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.796375Z"},"links":{"cited_paper":"/paper/2506.06664","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:c2feaae61ac096f6fd6ff59186131584e730c652218b499990c8b2d107d60a1e","observation_id":"71701eec-44e2-461e-9382-3e4e5b9274f0","resolution":{"observed_at":"2026-08-05T23:41:31.796375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15139","last_updated":"2025-04-10T08:48:37Z","snapshot_observed_at":"2026-08-10T01:38:52.929597Z","submitted_at":"2024-11-22T18:59:47Z","title":"DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15139","snapshot_observed_at":"2026-08-05T23:41:31.799889Z","title":"Diffusiondrive: Trun- cated diffusion model for end-to-end autonomous driv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.799889Z"},"links":{"cited_paper":"/paper/2411.15139","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:dc406001bbfff4ebda96a15dc15107fdb9f61d484e3ec5830e435b12a2df757e","observation_id":"2be68a7b-7bbd-49c4-9637-7eca3de7b726","resolution":{"observed_at":"2026-08-05T23:41:31.799889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.289998Z","title":"Diffusiondrive: Trun- cated diffusion model for end-to-end autonomous driv- ing","venue":null,"work_id":"17b46a32-f740-439e-86e9-298d2f88e985","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.803399Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:16a5d8176b1c0f1d29010dcbb2a4282bf1b9e5db922fbcf1290843373033ed2d","observation_id":"46338617-f4df-429c-b157-1ed26c088973","resolution":{"observed_at":"2026-08-05T23:41:32.293240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-05T23:41:31.807052Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.807052Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:025eafc75c64adfab94ac2e6563220dad7bed683d9e95bd68cbb7d33f5bf9b5e","observation_id":"c3cab5c8-2364-4ba4-b226-026b9df6c532","resolution":{"observed_at":"2026-08-05T23:41:31.807052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.280758Z","title":"Simlingo: Vision-only closed-loop au- tonomous driving with language-action alignment","venue":null,"work_id":"11d36d4d-1052-4c00-b7f8-4beeb2d45883","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.810869Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:5ba539b5a38aab3f8be69272fb055257996cd6aa7030d8c3dd66b4f1e42a2303","observation_id":"a7fe2bb6-be6c-4f05-bd13-76e76d5c13a4","resolution":{"observed_at":"2026-08-05T23:41:32.283875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.270558Z","title":"High-dimensional continuous control using generalized advantage estima- tion, 2018","venue":null,"work_id":"1e1a0be7-34ab-40fd-8269-2de3e96bd22f","year":2018},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.813938Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:c004bb3181690dd735c3a7ee43d07a5f972d71d2937de106ec3f2d763891f327","observation_id":"bd531091-cd19-4492-8439-a8e50e69d93c","resolution":{"observed_at":"2026-08-05T23:41:32.274253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.817547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.817547Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d1aa140c8f963acd0e4c1d29813172624c4f375088e775e5d5a0425ee8508a3b","observation_id":"39ef19ad-c823-45e8-a107-2e31eae148bc","resolution":{"observed_at":"2026-08-05T23:41:31.817547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19620","last_updated":"2024-05-31T07:40:55Z","snapshot_observed_at":"2026-08-10T01:38:48.954025Z","submitted_at":"2024-05-30T02:13:56Z","title":"SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19620","snapshot_observed_at":"2026-08-05T23:41:31.820894Z","title":"Sparsedrive: End-to-end autonomous driving via sparse scene representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.820894Z"},"links":{"cited_paper":"/paper/2405.19620","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:bce5a445aca294bf84b0d20918b578774088fe613000ddeec67a5ffa69041586","observation_id":"3bfb75c9-dc1a-4684-9f11-68baacb63df7","resolution":{"observed_at":"2026-08-05T23:41:31.820894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.253449Z","title":"Diffsemanticfusion: Semantic raster bev fusion for autonomous driving via online hd map diffusion, 2025","venue":null,"work_id":"123c93d3-d0e4-4d7a-a9ef-4c64def56c79","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.824390Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:ffb87538eadad31547ff432557beee2e613c7b81f65be70edab559dce79d84a4","observation_id":"be67406b-29b3-46b7-8ea6-1bf9730e4512","resolution":{"observed_at":"2026-08-05T23:41:32.256924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04412","last_updated":"2023-05-08T01:39:35Z","snapshot_observed_at":"2026-08-04T09:43:23.261807Z","submitted_at":"2023-05-08T01:39:35Z","title":"Efficient Reinforcement Learning for Autonomous Driving with Parameterized Skills and Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04412","snapshot_observed_at":"2026-08-05T23:41:31.827833Z","title":"Effi- cient reinforcement learning for autonomous driving with parameterized skills and priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.827833Z"},"links":{"cited_paper":"/paper/2305.04412","citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d7a3dd7da6c8df593eb3da99b14640d6082925df21eea43224e1e8c653f70b91","observation_id":"64093467-0a56-4ce8-aa72-b159878d7a16","resolution":{"observed_at":"2026-08-05T23:41:31.827833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.243478Z","title":"Carplanner: Consistent auto-regressive trajectory plan- ning for large-scale reinforcement learning in au- tonomous driving","venue":null,"work_id":"10d82449-8519-4d25-ba66-90d9c57fb3d2","year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.831351Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:93d9412a68bb0477fe424882c0c194d5864951ead557eae558693430903633a6","observation_id":"6a08dcfb-c46b-421c-951d-930a25083ecc","resolution":{"observed_at":"2026-08-05T23:41:32.246657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:32.231405Z","title":"Accelerating reinforcement learning for autonomous driving using task-agnostic and ego- centric motion skills","venue":null,"work_id":"7811cade-d477-4259-a93f-6dc2946ca325","year":2023},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.834652Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:081f58e7ef15b64ede20768d5f06512a10452ae1d1d8a5266d20efec62d8815e","observation_id":"915dc76c-a89d-4f05-af92-afa619e7bb84","resolution":{"observed_at":"2026-08-05T23:41:32.236597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:31.838029Z","title":"Opendrivevla: Towards end-to-end autonomous driving with large vision language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:41:31.838029Z"},"links":{"citing_paper":"/paper/2508.06571"},"observation_digest":"sha256:d888b730ecf16af9f7df3fc71eaed691057cc4882463326387d8b5b3b65aaf00","observation_id":"02553d1d-7218-4414-8240-7aa7760f6556","resolution":{"observed_at":"2026-08-05T23:41:31.838029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.06571","last_updated":"2025-08-15T05:19:30Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T23:41:31.354015Z","submitted_at":"2025-08-07T06:30:05Z","title":"IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 18 inbound Pith citation observations for arXiv:2508.06571."}