{"as_of":"2026-08-10T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11e9eb0e6afe95ac9ed336e02cd67e5afcf2908050989caa3e1ac4d51a0b864f","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:46:28.386276Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03872/citation-record","integrity":"/paper/2608.03872/integrity","json":"/paper/2608.03872/citation-record.json","paper":"/paper/2608.03872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.461189Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning,","venue":null,"work_id":"bd9dfdf1-d4e8-455e-8d7d-07290d4cb100","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:24.994176Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:088dba3384e392016107e1e6d7852a87c9e7fb35760a13f040d56636f65ae0c6","observation_id":"c6a5e125-819a-4c7c-81a0-a85a03ff8c17","resolution":{"observed_at":"2026-08-05T10:46:32.464484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.452773Z","title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning,","venue":null,"work_id":"9ae3a8c7-db2e-4d82-99a7-bafe18be7f0d","year":2024},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.057055Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:5089cc8034314bc621a60fb17bb45859d66680367700ac73a65746c4074365f0","observation_id":"3dbb61d6-3dbf-49e8-a7ff-f65676dc94be","resolution":{"observed_at":"2026-08-05T10:46:32.455706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.444342Z","title":"Efficient Online Reinforcement Learning with Offline Data,","venue":null,"work_id":"283f1b93-e1ab-4619-9d7c-9a66e9acebf5","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.109193Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:a2920151ef96116a94a6f48eb167a3c510c2665cc720195f0ca46041decec2ea","observation_id":"07bbcc99-6cde-46cd-8fe9-77c30a925837","resolution":{"observed_at":"2026-08-05T10:46:32.447346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.435995Z","title":"Reinforcement Learning in Robotics: A Survey,","venue":null,"work_id":"b0db1258-54f5-4a52-9232-1b030f33b3d2","year":2013},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.182950Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:1d3b0e8179644aee8d4a279a42319db295493a9aad0f337ac305499ea23b4861","observation_id":"7970e09c-8226-4a0b-84c3-cc097a6ca283","resolution":{"observed_at":"2026-08-05T10:46:32.438802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.427554Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation,","venue":null,"work_id":"a15acaa1-316f-46df-a257-b2028d243758","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.255645Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:1ba9ff918a91aa5251add3866998e446eeaf4db7c26cb8f36d8d5d45fd41a230","observation_id":"ee003f70-77fd-41ec-9553-583f223dc2f9","resolution":{"observed_at":"2026-08-05T10:46:32.430466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.419098Z","title":"How to Train Your Robot with Deep Reinforcement Learning: Lessons We Have Learned,","venue":null,"work_id":"5aa2c9ab-8a5e-4a1e-8da1-8e41e459615c","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.360263Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:78e5677af6f9e52ca656618383b8f24ce9ba5aef662cc3c8735dd367af3b9acb","observation_id":"b3096895-cdc3-49b6-a3f4-ac879ef16933","resolution":{"observed_at":"2026-08-05T10:46:32.421970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.409847Z","title":"Addressing Function Approximation Error in Actor-Critic Methods,","venue":null,"work_id":"0d32fab5-c150-4987-8963-05e359b48259","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.452881Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:3f81c9f8f1b7ea38ca382f67202edf74e40c6eba22ef388dcebde6d44b443cef","observation_id":"00b39d8e-ce23-45e3-bc7e-87952e9e97d3","resolution":{"observed_at":"2026-08-05T10:46:32.413050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.401320Z","title":"Offline Reinforcement Learning with Implicit Q-Learning,","venue":null,"work_id":"47583712-f46e-40cd-9a8b-d55b7c117c9e","year":2022},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.495996Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:543399e01c9868084a0c6c778cf354c0d64d43c8d11facb2baf848da2b4c405f","observation_id":"40e94431-dc38-4d66-b60b-a0f90c99a8b7","resolution":{"observed_at":"2026-08-05T10:46:32.404067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.392593Z","title":"A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning,","venue":null,"work_id":"93f28451-e76a-4ca2-b279-91378aa468bc","year":2011},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.561058Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:51b157a371da9e1962ef410a1762a0988136bf503547e7ef3bf7abac2b3b4ebc","observation_id":"2a819dc0-b74a-4df3-8ca1-d924d20837c4","resolution":{"observed_at":"2026-08-05T10:46:32.395749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.383864Z","title":"HG-DAgger: Interactive Imitation Learning with Human Experts,","venue":null,"work_id":"b6f5eaa1-d6f1-4b76-8931-7a9adb8eca24","year":2019},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.622269Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:c98a930dac09f9120cbb0ffffc23675b9303527b29167577fc212f8724a85245","observation_id":"34b44d0c-441e-4c62-8145-4a128c3a3356","resolution":{"observed_at":"2026-08-05T10:46:32.386727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.375311Z","title":"Deep Reinforcement Learning from Human Preferences,","venue":null,"work_id":"a92fcc7b-6fa8-4630-99bd-a8cfbf5cb04d","year":2017},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.690310Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:67459f8df22cc98d3621a5b56f1f8180f079bc5c148a19c657150ee9a0639427","observation_id":"f17c478f-2b73-4db6-9063-41c732a28843","resolution":{"observed_at":"2026-08-05T10:46:32.378305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.366294Z","title":"Variational Inverse Control with Events: A General Framework for Data-Driven Reward Definition,","venue":null,"work_id":"8d0e29fa-3cf8-498c-a1a9-781a0ec84691","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.781019Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:d79e998eb8bb92cb5e6c0a4f4a1a34297e268b0321d8968391969539a34b1725","observation_id":"4a128a76-9719-4ecd-acc5-a861f86a7e73","resolution":{"observed_at":"2026-08-05T10:46:32.369472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.357817Z","title":"Positive-Unlabeled Reward Learning,","venue":null,"work_id":"67581cd1-bd15-451c-9c86-e9cda65cd078","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.865527Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:06164fc26bb976fd06c3eebecb605e25b3eb60c60dd08026c35a073a4e3fe77d","observation_id":"0483ecda-299b-411f-be2a-7c5315a3f4ac","resolution":{"observed_at":"2026-08-05T10:46:32.360738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.226238Z","title":"Human-Guided Online Reward Adaptation for Real-Robot Arm Manipulation,","venue":null,"work_id":"0a13811f-3284-42fe-8673-033eb442fc52","year":2026},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:25.947347Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:fef2cb0a45792978ea60f711b77403af0a7725b8a0e4ab91b0b69b193264ffe1","observation_id":"0cb43490-8acb-4247-9fd0-dd6f41a666e9","resolution":{"observed_at":"2026-08-05T10:46:32.350941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:32.089455Z","title":"On Calibration of Modern Neural Networks,","venue":null,"work_id":"9d074536-94ef-4eba-8fe3-cec91cc6ddd8","year":2017},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.034319Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:eb3da02777179ea4c3a30f8e5d6961a143530c3e1b80ec0d7a43857199d01ad7","observation_id":"69bc05e6-d327-4c3b-9aed-b739e9514e80","resolution":{"observed_at":"2026-08-05T10:46:32.194875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.894126Z","title":"Learning from Imbalanced Data,","venue":null,"work_id":"96abc869-2900-40be-a7b6-91cf9caf7405","year":2009},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.110725Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:29c3b1cf9e82f9f2f31e1c0a93ec17f68f7f52bcd09297755a1e26079acb1920","observation_id":"723355f4-b2c4-4eb5-b93a-4753b1fbb54b","resolution":{"observed_at":"2026-08-05T10:46:31.989060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.610087Z","title":"A Survey on Concept Drift Adaptation,","venue":null,"work_id":"1555cfe0-8e67-4975-a414-625a227e6c6d","year":2014},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.162134Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:58a349a852732bada141b9388a1cfbaa162820bbd201338c1461327580fcfeb3","observation_id":"2ac28726-310c-4896-acc0-01e4ed9f700b","resolution":{"observed_at":"2026-08-05T10:46:31.758765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.295362Z","title":"Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift,","venue":null,"work_id":"a845f43b-cb0a-4467-a4f0-2afc1ceb9304","year":2019},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.229088Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:7aa79cd2ff8b64af92a1b4cc96b8e71ce404ae8d065d19d476161cbe6e2afc2f","observation_id":"59d41c21-fca4-407a-857b-bdf9634e7584","resolution":{"observed_at":"2026-08-05T10:46:31.454474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:31.106852Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion,","venue":null,"work_id":"3c81940c-67b6-49d0-96f0-bcbce937e54e","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.255218Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:cef296231606c4872f463d3d0ec199f300f11a4e1f55127ced8242f34afb330d","observation_id":"d5cb31de-eda3-46a4-bd7d-c5bb94bd9ddd","resolution":{"observed_at":"2026-08-05T10:46:31.134034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.937690Z","title":"Implicit Behavioral Cloning,","venue":null,"work_id":"578f740e-b0c4-4b35-9777-a9a3f8054625","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.342791Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:6c8a99a940354104da7efa1b1a6b0f940cb6c5c12b44e8214a81ea242e2060b2","observation_id":"a22c2192-035a-45e7-90ae-1e414fee8020","resolution":{"observed_at":"2026-08-05T10:46:31.028914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.774941Z","title":"Flow Matching for Generative Modeling,","venue":null,"work_id":"87ce3681-f3eb-4b99-acca-fdeb9d1945bf","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.396151Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:886df49fdbd3caedb9b202928f7683b5d43ae2668ea0511446ee9ec6860b0d06","observation_id":"32dbd220-c69c-442c-be16-d6c59c2bd1f1","resolution":{"observed_at":"2026-08-05T10:46:30.835593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.652344Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow,","venue":null,"work_id":"74a907de-db18-48c2-903e-2d928664a758","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.458504Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:4c1d6394037c8d5e056d72bdb6fde61983bc6f8ec84651a737cf5b8f99602f49","observation_id":"9a1dcbfa-d030-4544-b0af-da1932723aba","resolution":{"observed_at":"2026-08-05T10:46:30.713808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.571717Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware,","venue":null,"work_id":"9666ab02-8556-4120-8fda-a1b38efac848","year":2023},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.561614Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:9f78ae03d2839d778f87304d0cc6f074f2e408d80981f5d6d933b7e444d3343d","observation_id":"dbb56229-7bfe-4981-8084-ad4297a29541","resolution":{"observed_at":"2026-08-05T10:46:30.580894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07969","snapshot_observed_at":"2026-08-05T10:46:26.613179Z","title":"Reinforcement Learning with Action Chunking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.613179Z"},"links":{"cited_paper":"/paper/2507.07969","citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:8bbcb387513f5c1aee0fd4205d3f81df65d1cd7344cbe2de57812408dcb73e02","observation_id":"6d19b647-08af-4fa0-a909-304ec2ad1165","resolution":{"observed_at":"2026-08-05T10:46:26.613179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.458424Z","title":"Diffusion Policy Policy Optimization,","venue":null,"work_id":"4cb1ba60-6742-4045-a568-35f9f5702393","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.667042Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:8cf9897a288d14a9b4c9ae5845647ce2598ac4205d76b83d5d24573d29ed6c70","observation_id":"83299f6f-d6a1-4a29-8389-38c1d2a70f88","resolution":{"observed_at":"2026-08-05T10:46:30.513155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.371080Z","title":"ReinFlow: Fine-Tuning Flow Matching Policy with Online Reinforcement Learning,","venue":null,"work_id":"05bc7ca9-f36c-441a-b46d-d2dd9046cd2b","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.770861Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:bf2180d8bece01b35e10298ec65beb2208d351635c45fce71cc202d4adcd4722","observation_id":"d2f9b537-f368-497f-969b-1ce7105477e0","resolution":{"observed_at":"2026-08-05T10:46:30.409585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.285642Z","title":"Flow Matching Policy Gradients,","venue":null,"work_id":"0473cd8b-d96b-4dd0-933f-e87098635be7","year":2026},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:26.927731Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:b49c9decbf6d1dea41a34c839027ff49ab5f420c37f39307d4527b3f31c9f671","observation_id":"6923b95e-7b69-446d-afe5-258403ac8ab1","resolution":{"observed_at":"2026-08-05T10:46:30.323687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:30.107034Z","title":"SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Model- ing,","venue":null,"work_id":"b5b39397-5f0a-42c4-84a3-298036adee81","year":2026},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.068200Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:2b3d44df4aaf1b5363c0f0810511a110197c32517ec82d3e5c6e5a90d1667a61","observation_id":"6cd7f075-b8fa-4009-92b8-47037a1cc47d","resolution":{"observed_at":"2026-08-05T10:46:30.197362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.912428Z","title":"Reinforcement Learning with Augmented Data,","venue":null,"work_id":"14e20f43-a708-48a4-9962-75861828f89e","year":2020},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.111855Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:49004fa102aacc9d7b0474e315fef8097c3c0ec2d3e331a43f42db03351967e5","observation_id":"2517fc5d-0c76-4dc7-a093-946cd622f38c","resolution":{"observed_at":"2026-08-05T10:46:29.994478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.768501Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels,","venue":null,"work_id":"2c874333-7ae0-4c2b-a71d-9bf58725ae8c","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.230961Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:51a9ecc24d33b84a852338b534045df69dfbc3ebbc1af3bfe28da2127e0f2027","observation_id":"e7cf9319-7bf0-4076-bc40-bdd9ec4bd6f4","resolution":{"observed_at":"2026-08-05T10:46:29.825849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.618226Z","title":"Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World,","venue":null,"work_id":"bd02f750-af79-4559-88f4-e7a45f4123c8","year":2017},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.392105Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:5d79c2a54afa43df0bdfddbd713cf1a350590de2e4025f4e67cbfead17babc4f","observation_id":"ccc354a0-1743-4129-8397-473e10f00ace","resolution":{"observed_at":"2026-08-05T10:46:29.674788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.483734Z","title":"AugMix: A Simple Data Processing Method to Improve Robustness and Uncertainty,","venue":null,"work_id":"bbc2c139-1d9e-4234-a137-1ccb1a005b8a","year":2020},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.549821Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:0dcf64f37b868bf3fbbd821e2d0fa11cd0fd651358c59306c4535403b3bdfab4","observation_id":"bc970c47-367d-4ff0-a7e2-d1f5bbaa39a3","resolution":{"observed_at":"2026-08-05T10:46:29.554995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.364285Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control,","venue":null,"work_id":"841ab184-25ac-4c59-ba7c-06af02b67a73","year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.685656Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:c03e8552fa03341da121b225db2261804183113c1ff2af669df3b2456add26b5","observation_id":"f97f4f2d-835f-4c2c-a10a-38183256577b","resolution":{"observed_at":"2026-08-05T10:46:29.420052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.225210Z","title":"Experience Replay for Continual Learning,","venue":null,"work_id":"60356a45-b29c-46ed-abef-f6032e13cfeb","year":2019},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.797275Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:9423988b597044710174fd172bc1c2111d698bcca593e4e88bc9a22aa691d325","observation_id":"dc7d9fb0-6292-4c23-88a6-5756ed7bfc09","resolution":{"observed_at":"2026-08-05T10:46:29.280319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:29.106446Z","title":"Regularizing Action Policies for Smooth Control with Reinforcement Learning,","venue":null,"work_id":"143692d2-3806-4d0a-a4c3-b5539c7eb23e","year":2021},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:27.907550Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:73658c25cbc806f9e9a0b8b35bc7a738107273f47501746588a221a95ca7c922","observation_id":"474f25e8-3476-42bd-b255-702e7abdd32d","resolution":{"observed_at":"2026-08-05T10:46:29.166038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.928127Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor,","venue":null,"work_id":"f05dd7f8-9a62-4e8f-99aa-96831f52c5fc","year":2018},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.019240Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:6871286d2ae8af30f235f2a5f5e7648b4453a6474f09c811ae7eb44e9ab9ffcc","observation_id":"e85a1045-5005-4159-8b4c-1f52b905c0ff","resolution":{"observed_at":"2026-08-05T10:46:29.009607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.776566Z","title":"Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping,","venue":null,"work_id":"88986333-e9d9-464e-9b10-2f3de05cf986","year":1999},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.152810Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:659adfbd315153c44503ffe8e2d6fb56a543e32a2ac7832a4a4209a9f2b0ce09","observation_id":"7c8b414a-ce74-4b4e-82e7-1ad220966588","resolution":{"observed_at":"2026-08-05T10:46:28.840976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.600787Z","title":"Imitation Bootstrapped Rein- forcement Learning,","venue":null,"work_id":"5cf09b9c-c121-433b-acd4-6417f3fbc977","year":2024},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.219528Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:e76a6bf709eaf59851f33b14da41883ec2326532cdac6584c483a903ad5894a4","observation_id":"a2cf5f71-6aba-4db1-acfc-d02d664a6107","resolution":{"observed_at":"2026-08-05T10:46:28.686166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:46:28.493921Z","title":"Deep Residual Learning for Image Recognition,","venue":null,"work_id":"eb831107-bf26-4590-ab03-2b4dd0b7bbe6","year":2016},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.301849Z"},"links":{"citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:19371ad35a6a370a4435ed599fd30a54bef2f24a3b67e62e3d770d8c32307367","observation_id":"8d219ba2-7854-4e8b-bbaf-96a92aaa9b08","resolution":{"observed_at":"2026-08-05T10:46:28.536036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15673","last_updated":"2025-06-18T17:56:45Z","snapshot_observed_at":"2026-08-09T08:25:00.126076Z","submitted_at":"2025-06-18T17:56:45Z","title":"UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15673","snapshot_observed_at":"2026-08-05T10:46:28.386276Z","title":"UniRelight: Learning joint decomposition and synthesis for video relighting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:28.386276Z"},"links":{"cited_paper":"/paper/2506.15673","citing_paper":"/paper/2608.03872"},"observation_digest":"sha256:167a3900a964d56e1eef8229e7cd275c547fe312faccd3a6123820fcc26ad2e6","observation_id":"e6f0ca36-6b27-4b5b-9b06-5f9778184faf","resolution":{"observed_at":"2026-08-05T10:46:28.386276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03872","last_updated":"2026-08-04T16:12:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T23:12:35.539914Z","submitted_at":"2026-08-04T16:12:05Z","title":"EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.03872."}