{"as_of":"2026-08-10T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7addcb553535de56c970daa88bb584a1be7df4d0645f0ae184bcf9f2ebe42a59","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:30:23.710832Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:51:28.966906Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T12:43:17.233166Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"cited_work":{"arxiv_id":"2509.04063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04063","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.04063 , year=","venue":null,"work_id":"33a1475b-c02e-497e-96d1-f4f93d4a89a7","year":2025},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2509.04063","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:b508f5b05c11c3da80f81cd6d850b8022f7e6f7f76956127c953b19ec718feb8","observation_id":"0515b405-0150-47b2-86a7-06e4b120a5ca","resolution":{"observed_at":"2026-05-18T07:31:02.908493Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04063","snapshot_observed_at":"2026-08-04T05:51:28.966906Z","title":"Balancing signal and variance: Adaptive offline rl post-training for vla flow models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15257","last_updated":"2026-08-02T20:22:57Z","snapshot_observed_at":"2026-08-07T11:00:16.440130Z","submitted_at":"2026-03-16T13:24:58Z","title":"HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:28.966906Z"},"links":{"cited_paper":"/paper/2509.04063","citing_paper":"/paper/2603.15257"},"observation_digest":"sha256:0d58a646c2af99d04b607b7d7871e550ae0ca11128a9ff9b79e5e5feb06da3d0","observation_id":"523fe429-f1b8-4cb6-8c19-09b961db3bf4","resolution":{"observed_at":"2026-08-04T05:51:28.966906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"cited_work":{"arxiv_id":"2509.04063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04063","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.04063 , year=","venue":null,"work_id":"33a1475b-c02e-497e-96d1-f4f93d4a89a7","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2509.04063","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:05f5a3871fed606bba6815483614604de49dd370597bd33b548ed94500621166","observation_id":"6ef27ad8-2026-4fda-934b-461fa5a9a422","resolution":{"observed_at":"2026-05-20T12:43:17.235496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04063/citation-record","integrity":"/paper/2509.04063/integrity","json":"/paper/2509.04063/citation-record.json","paper":"/paper/2509.04063"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:23.444500Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.444500Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:ed1adac2fc5b52bb5a6b3b87ae3f13a168331e089c354435d9d35e1df6768f24","observation_id":"3e864b4a-3641-41f4-a30f-edb30d1a5381","resolution":{"observed_at":"2026-08-05T10:30:23.444500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:23.451025Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.451025Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:806472c8eaecc4e9302cdbe278b4ff1388e3e97ce369b32f20a1f7c99f3c35ee","observation_id":"22c3cd8a-a31b-4e15-af7b-55d50703bf4e","resolution":{"observed_at":"2026-08-05T10:30:23.451025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.514316Z","title":"B.; Jaakkola, T","venue":null,"work_id":"0d677c98-8092-42b5-9b88-0b7d6cb4aefb","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.457237Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:11b8a3a73f5c7aad8fd35bdb3c3f6e549e2873317719b69e489c6f8e4d47dfd5","observation_id":"27ed1442-1a51-4744-899a-bc5d90be4341","resolution":{"observed_at":"2026-08-05T10:30:24.520293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:23.463943Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.463943Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:a519e13bd3fc3bdef80af2283a262b099fdc8e0c7799cdc9b4b6a2c3d5829d14","observation_id":"57708748-ee58-4c4c-af3c-4baef8fcf1a6","resolution":{"observed_at":"2026-08-05T10:30:23.463943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T10:30:23.469543Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.469543Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:42ce2ab13ba6117dce5750df4979a472ecabe696142502eb5ed1a3b6f722c5be","observation_id":"49033faf-97a7-4f53-9d63-22125454ec02","resolution":{"observed_at":"2026-08-05T10:30:23.469543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-05T10:30:23.475841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.475841Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:0d70f2ea00306f15683f549c7b9e9a76a4563c1372706eb9887502f98935adb2","observation_id":"aebd0cbe-21f0-4217-8ae9-d1bdccd21934","resolution":{"observed_at":"2026-08-05T10:30:23.475841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T10:30:23.481852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.481852Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:fce0033367fe1f87a48048d57e6a7038eb20d8f35e78791035258b54fe407736","observation_id":"fa1a897c-afaf-4e44-9a1c-d5a82059ee22","resolution":{"observed_at":"2026-08-05T10:30:23.481852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T10:30:23.488324Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.488324Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:81fe41fcb6dfba4be3766e9d638b7d0ea142d052dfa82269c3e20091f1815bbb","observation_id":"d63c2495-1ddf-4d7f-88f7-592d5332d574","resolution":{"observed_at":"2026-08-05T10:30:23.488324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.484586Z","title":null,"venue":null,"work_id":"d98f2fcf-f158-4d31-b49a-6c75604ea342","year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.495241Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:0b99d07ad173d425befdbd4f2c5df6aacba90fe89608868519a9b6ffce46df85","observation_id":"c214714c-c744-48ab-87ce-77d35e271900","resolution":{"observed_at":"2026-08-05T10:30:24.490508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.466203Z","title":null,"venue":null,"work_id":"ad28f6ed-0ddb-48ed-a48d-d2c0783e87fd","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.500979Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:290f873f70dc342059cdd58ca110edc52d1fb0bbd1464e9ac62e25c99ea989e8","observation_id":"c308da86-c944-4c17-bc8f-eba9bc4d20ae","resolution":{"observed_at":"2026-08-05T10:30:24.471335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.448906Z","title":null,"venue":null,"work_id":"bafd796e-82da-4088-9628-4475335cb274","year":2021},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.508419Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:c3cc84e620d8e04d583e91cc1a451f10fcfa49949c4fb756bc656c940e56dd41","observation_id":"bb9929da-5aa4-48c0-abff-d109b0443be8","resolution":{"observed_at":"2026-08-05T10:30:24.454442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07366","last_updated":"2019-12-14T02:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-06-19T17:50:12Z","title":"Neural Ordinary Differential Equations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07366","snapshot_observed_at":"2026-08-05T10:30:23.515915Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.515915Z"},"links":{"cited_paper":"/paper/1806.07366","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:f145b4fc3d28764da95323ff66d8631dfd642547e0e5049fa9923fa255d6b79c","observation_id":"dfe423ff-3d87-449c-a8c7-b60679f9a6a8","resolution":{"observed_at":"2026-08-05T10:30:23.515915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08259","last_updated":"2025-01-14T17:15:27Z","snapshot_observed_at":"2026-08-06T07:18:39.680193Z","submitted_at":"2025-01-14T17:15:27Z","title":"FDPP: Fine-tune Diffusion Policy with Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08259","snapshot_observed_at":"2026-08-05T10:30:23.521640Z","title":"K.; Tomizuka, M.; and Romeres, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.521640Z"},"links":{"cited_paper":"/paper/2501.08259","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:98886a918a4ea3f1bceeffd19448320c571c89de9aabec735adb5f9255ecee64","observation_id":"f3e1c7e4-be1d-42dd-a51d-db9aa39d679a","resolution":{"observed_at":"2026-08-05T10:30:23.521640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.431248Z","title":null,"venue":null,"work_id":"c83be979-8898-4e14-b183-d5c783551cab","year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.527844Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:9f0e655a355f8d5d5ddc978722fcb4f4e5275ab0f284e38d4afde1ccf1a59ffb","observation_id":"7dace495-c2da-4461-814f-4faa88315a76","resolution":{"observed_at":"2026-08-05T10:30:24.437323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.413165Z","title":"S.; Lynch, C.; Chowdhery, A.; Wahid, A.; Tompson, J.; Vuong, Q.; Yu, T.; Huang, W.; et al","venue":null,"work_id":"abf961c9-1dec-4fa4-b522-efdc998ecd21","year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.533520Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:490e994a1eee0717bffac1db6de0199436bc0a51390e05af4e2867c946ba2d56","observation_id":"f6f29c4d-4779-4f8d-9a3b-b6b65dca152f","resolution":{"observed_at":"2026-08-05T10:30:24.419516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-06T21:08:23.353594Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-05T10:30:23.538701Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.538701Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:afb6a214fd9a04aaf324f12ce0ba9b0b3d627c9568d206694a6d743131b40fb8","observation_id":"35ba3196-ca77-4c1e-8e83-1549cb75e2ac","resolution":{"observed_at":"2026-08-05T10:30:23.538701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T10:30:23.546728Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.546728Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:94a12ebbcaf178631275dd9f928f469d4cfe4a95adad9199885045b6a1497891","observation_id":"06c6519d-9fdc-4bb8-9e5e-546e23baea4f","resolution":{"observed_at":"2026-08-05T10:30:23.546728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T10:30:23.552915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.552915Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:28e9f55d62ac59373ef4d481550a434947b38042224a54aa2287e2ff2851423f","observation_id":"ce01b314-0f73-42dd-81e9-bb2039a2668e","resolution":{"observed_at":"2026-08-05T10:30:23.552915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.396970Z","title":null,"venue":null,"work_id":"a402e11e-4345-4d47-8a2a-3cc37b5bee0b","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.558652Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:465a73f1b5ed93a985f912f15d0d0655c8c4b2526bda90ae62bcb3815a153b67","observation_id":"4f31f06f-4b50-42b9-ad72-780caa8b1bbb","resolution":{"observed_at":"2026-08-05T10:30:24.401852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T10:30:23.563766Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.563766Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:916ff61d2663e87b89425953be90c7aa786af29fd715af1993df12e1e4142131","observation_id":"a8d857f0-8d2b-45f4-a6b8-b9b67151b6f9","resolution":{"observed_at":"2026-08-05T10:30:23.563766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.375383Z","title":null,"venue":null,"work_id":"5beea029-e06c-4da0-9568-5b2f8c8aa58f","year":2019},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.570311Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:4f13e40bd66b6ada2d3a44ba11654a08c9c3c196c07d94b979d18ac1a0173a54","observation_id":"e284bcf8-56be-4f37-b6e2-3a5bd1de3fd5","resolution":{"observed_at":"2026-08-05T10:30:24.382885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T10:30:23.576111Z","title":"R.; Fu, C.; Lunawat, I.; Sieh, I.; Kirmani, S.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.576111Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:ac4554479d3a7feee485938cb447b56fd042dd6f86ae65a11605198aec4ab126","observation_id":"79743d51-d3a7-4fd5-a3a7-23ca43a66281","resolution":{"observed_at":"2026-08-05T10:30:23.576111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T10:30:23.582107Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.582107Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:a215ee94c19f7021fb2203ee800c70ad2e9b36917948c2cd872fe569008c1d3d","observation_id":"fe88a4da-8409-4ba1-9ecd-04a26d19ce36","resolution":{"observed_at":"2026-08-05T10:30:23.582107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-05T10:30:23.587313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.587313Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:896c8b3a75f27fb1e047a1c6b93b4265d35ab9d39b5db8b5b7c4a8a98fa44a12","observation_id":"1bdee1ee-8647-4c50-93e4-15dd49ab6174","resolution":{"observed_at":"2026-08-05T10:30:23.587313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T10:30:23.593021Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.593021Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:3c06017cbe843f875048f074b060b63b5b870015f6e7477e7ffb9b462a7c4769","observation_id":"2a368fcf-5caa-4743-9d43-14b625537fab","resolution":{"observed_at":"2026-08-05T10:30:23.593021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.355683Z","title":null,"venue":null,"work_id":"c93ed788-7e30-4dcb-b954-cbbbb13fadd3","year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.598619Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:c7ae1dc6ef4ad3b0b8427b37229ac8576e23c13aa936fba39b4874f6f9ab3bcf","observation_id":"6e05dbf2-4666-4a20-870d-2f28538071a6","resolution":{"observed_at":"2026-08-05T10:30:24.361360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-05T10:30:23.605483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.605483Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:e9c2f7aab10bbf48554a4f230219bc2b4539fb17dc9fc8b14ebb9e05a61e80f2","observation_id":"7cc1bd6a-b221-4f54-b7e7-2c0543864e5a","resolution":{"observed_at":"2026-08-05T10:30:23.605483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-05T10:30:23.611023Z","title":"S.; Gao, T.; Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.611023Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:b0a29af8e1f5aad6d663db0d092e97396b646fbe0956d742115468be77143fb4","observation_id":"cdd8c86c-0b3b-4f1a-af6f-f9b4914be986","resolution":{"observed_at":"2026-08-05T10:30:23.611023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.337347Z","title":null,"venue":null,"work_id":"dc8bec7e-2ef4-4049-a6ab-3e851d811989","year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.616193Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:40c9024bb72355a5a09708b5c3a9c579a36e5aaaa6617618028becf58933884f","observation_id":"2f15b711-1537-4c34-acf5-e1a2688baef3","resolution":{"observed_at":"2026-08-05T10:30:24.343397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13816","last_updated":"2025-02-24T21:05:58Z","snapshot_observed_at":"2026-08-05T20:44:16.574781Z","submitted_at":"2024-10-17T17:46:26Z","title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13816","snapshot_observed_at":"2026-08-05T10:30:23.621321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.621321Z"},"links":{"cited_paper":"/paper/2410.13816","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:bd84ab23a28619a6f2f9bd8f20ecd91a00fe3f7cfe2d389f91c04136e7b008d0","observation_id":"f81a2e7d-54e7-48a4-a8d8-e0ffe599cf5c","resolution":{"observed_at":"2026-08-05T10:30:23.621321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.320472Z","title":null,"venue":null,"work_id":"d11d502e-24f7-4a34-b2d7-db40de498fd5","year":2007},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.626576Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:b8ddbe43f49c7fabc68efd15210552f94f72d7a9d4b872b1b80d52fa2da24ec8","observation_id":"536ba1d1-401a-476c-bf6a-ebd0758db317","resolution":{"observed_at":"2026-08-05T10:30:24.326271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-05T10:30:23.635769Z","title":"E.; Wenzel, F.; and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.635769Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:fd49da79ad2a831e0996b187343661e3ca64e0e5eaa80d5bab61f33fee3bd9d9","observation_id":"ffee3e7b-3f88-4282-9ee9-d2b050e62ed1","resolution":{"observed_at":"2026-08-05T10:30:23.635769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T10:30:23.641166Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.641166Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:8930ac92dbf4c337b124a6a713bb99fbc31f40bde1352b6d241953d18ab80032","observation_id":"d44e2bf0-3e45-4016-bd0e-0320436923be","resolution":{"observed_at":"2026-08-05T10:30:23.641166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-08-05T10:30:23.646643Z","title":"a henb \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.646643Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:ca22c73d777f3bc16d9525f2ae5a99069c5aa2393805c2dcb8778c752168aa8b","observation_id":"8bc3f0bd-77b6-4e4c-9cbe-07689334638b","resolution":{"observed_at":"2026-08-05T10:30:23.646643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T10:30:23.652369Z","title":"M.; Ghosh, D.; Walke, H.; Pertsch, K.; Black, K.; Mees, O.; Dasari, S.; Hejna, J.; Kreiman, T.; Xu, C.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.652369Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:da6f8115f7d74e8a233fce75bd8cd2c47a4c70cb46d841b7cfd31302812c4670","observation_id":"63d5175f-027b-465e-8d22-c3e5fbc4fa6b","resolution":{"observed_at":"2026-08-05T10:30:23.652369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.303267Z","title":"J.; and Zhou, M","venue":null,"work_id":"35832b92-3579-4953-b878-ff82a0a7665a","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.658056Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:17879befbd913f3e91aba5700b4617d95028bc6e3593c556a2c5843058adae90","observation_id":"b8a9a791-599a-409c-89db-a0c000554697","resolution":{"observed_at":"2026-08-05T10:30:24.308875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.283286Z","title":null,"venue":null,"work_id":"42cdffb7-a1c9-4b25-94d5-59ea927b26a3","year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.664002Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:73cf8a77fbfb27cf33b9425e6d703c08ea7119b715a1542ecc311fba754d242d","observation_id":"dd6f62e4-7bcf-4126-aae7-ce8dc1fdf77f","resolution":{"observed_at":"2026-08-05T10:30:24.289673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07395","last_updated":"2025-05-12T09:48:03Z","snapshot_observed_at":"2026-08-07T15:47:55.977732Z","submitted_at":"2025-05-12T09:48:03Z","title":"ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07395","snapshot_observed_at":"2026-08-05T10:30:23.670740Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.670740Z"},"links":{"cited_paper":"/paper/2505.07395","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:4001d023298cc9d2c9c21616e61787f78e2ad24cb6e0060acd3175c372e5dbbc","observation_id":"c66a75f6-4f55-462d-b786-087c9b8bb200","resolution":{"observed_at":"2026-08-05T10:30:23.670740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04975","last_updated":"2025-03-06T21:10:12Z","snapshot_observed_at":"2026-08-07T17:23:30.914733Z","submitted_at":"2025-03-06T21:10:12Z","title":"Energy-Weighted Flow Matching for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04975","snapshot_observed_at":"2026-08-05T10:30:23.678531Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.678531Z"},"links":{"cited_paper":"/paper/2503.04975","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:6e41cb4dcfc5eae08eed05d52e2f7f29b4a3ca37f7caa4f83e1a1bb755555f4b","observation_id":"94d2adb0-a693-488f-9d59-14070dd5b872","resolution":{"observed_at":"2026-08-05T10:30:23.678531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T10:30:23.688049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.688049Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:04abe58b795eba90834a50f62c5983326732e61116af53f4ddc38d412639a0cd","observation_id":"02898c68-a010-4aa3-adf2-0cfe4243bf80","resolution":{"observed_at":"2026-08-05T10:30:23.688049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08007","last_updated":"2025-03-11T03:13:45Z","snapshot_observed_at":"2026-08-07T17:14:29.980290Z","submitted_at":"2025-03-11T03:13:45Z","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08007","snapshot_observed_at":"2026-08-05T10:30:23.695864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.695864Z"},"links":{"cited_paper":"/paper/2503.08007","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:8412c0cdb29e4bb0c17e125861db3415c72ae412f986afdb5528022965da9f28","observation_id":"8630cad3-afcf-41be-86f7-535f15cd85e6","resolution":{"observed_at":"2026-08-05T10:30:23.695864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-07-06T16:51:10.736675Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-05T10:30:23.703140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.703140Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:8aab147c1da5222eb17bcbf88d0444fe8d4e5fd6012b78d4248a8ba20b861c6b","observation_id":"6ef7b8c5-a478-446f-a696-a7c7126604be","resolution":{"observed_at":"2026-08-05T10:30:23.703140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08740","last_updated":"2024-06-02T10:15:53Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:30:03Z","title":"Reinformer: Max-Return Sequence Modeling for Offline RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08740","snapshot_observed_at":"2026-08-05T10:30:23.710832Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.710832Z"},"links":{"cited_paper":"/paper/2405.08740","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:beb2844c2e86bbad20bd72d11854d5901745b99ac85fc0a2161e42a83feed6bc","observation_id":"5f98f877-341c-4bed-be13-e0f6251079c8","resolution":{"observed_at":"2026-08-05T10:30:23.710832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2509.04063."}