{"as_of":"2026-08-16T07:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31ec0e485e69d088266046bedebf1b2bb3d414fa64815d91d3a4a155fcd2adfc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:13:00.393031Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:16:11.130271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:19:37.801846Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.12811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12811","snapshot_observed_at":"2026-07-04T06:19:37.801846Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":"51816cd1-96b3-4c29-8b2b-90a8c5b8894c","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-08-15T20:11:55.676895Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2506.12811","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:27673bc495a20ae28382a5864ea2baf0479e594bc75333d9ceb1fbc8ff4a2ed3","observation_id":"a3f2938f-aa5c-4a56-b8e3-6a47e1da3c77","resolution":{"observed_at":"2026-05-15T16:36:17.961170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.12811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12811","snapshot_observed_at":"2026-07-04T06:19:37.801846Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":"51816cd1-96b3-4c29-8b2b-90a8c5b8894c","year":2025},"citing_paper":{"arxiv_id":"2605.01356","last_updated":"2026-05-02T09:59:24Z","snapshot_observed_at":"2026-08-10T21:20:38.301087Z","submitted_at":"2026-05-02T09:59:24Z","title":"Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:58.919333Z"},"links":{"cited_paper":"/paper/2506.12811","citing_paper":"/paper/2605.01356"},"observation_digest":"sha256:9d536b242d03b299940b73297e37a5cc8a837c046b3890851852f91c1294da38","observation_id":"7a5816e2-7622-49d0-9370-8686d0084056","resolution":{"observed_at":"2026-05-11T16:56:07.772811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.12811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12811","snapshot_observed_at":"2026-07-04T06:19:37.801846Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":"51816cd1-96b3-4c29-8b2b-90a8c5b8894c","year":2025},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-15T22:55:45.378662Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2506.12811","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:6205291f06538d566f10b669ac70c45e1fd33853d5633ad174584a3174e50220","observation_id":"1274de69-c92b-4002-9014-8ce57310826e","resolution":{"observed_at":"2026-07-03T04:17:36.879087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.12811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12811","snapshot_observed_at":"2026-07-04T06:19:37.801846Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":"51816cd1-96b3-4c29-8b2b-90a8c5b8894c","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2506.12811","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:99802f41f24ca312e09bd24b8c97852c6501b88ec87123739b0abd015324680a","observation_id":"53d83936-0ddb-46c2-85f7-48147fa6f40b","resolution":{"observed_at":"2026-07-04T06:19:37.803584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.12811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12811","snapshot_observed_at":"2026-07-04T06:19:37.801846Z","title":"Flow-based policy for online reinforcement learning","venue":null,"work_id":"51816cd1-96b3-4c29-8b2b-90a8c5b8894c","year":2025},"citing_paper":{"arxiv_id":"2606.29820","last_updated":"2026-06-29T05:57:33Z","snapshot_observed_at":"2026-08-02T04:45:58.960142Z","submitted_at":"2026-06-29T05:57:33Z","title":"Dual-Flow Reinforcement Learning with State-Aware Exploration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T07:16:11.130271Z"},"links":{"cited_paper":"/paper/2506.12811","citing_paper":"/paper/2606.29820"},"observation_digest":"sha256:ec883c0f57ac1092ab76540dc2cddcb0b2d27fd3c4200cc0475bd0d631718500","observation_id":"450a06e7-e743-494f-bce1-df4265c25f7d","resolution":{"observed_at":"2026-06-30T07:24:21.792831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12811/citation-record","integrity":"/paper/2506.12811/integrity","json":"/paper/2506.12811/citation-record.json","paper":"/paper/2506.12811"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.214500Z","title":"A markovian decision process.Journal of mathematics and mechanics, pages 679–684, 1957","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.214500Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:d0b8b3d9e9faa60378691aa3c31572a0c038c8a1e48ecda4fef03b281e86e4fa","observation_id":"80413add-a181-4e55-9b7a-6e83205e7cef","resolution":{"observed_at":"2026-08-15T20:13:00.214500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T20:13:00.218998Z","title":"A vision-languageaction flow model for general robot control.arXiv preprint arXiv:2410.24164, 2(3):5, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.218998Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:65b0883eabb8034d9e041c332382c831eadb3b3b2615cb5dc146c8a1133b9a1c","observation_id":"9b0c6a2b-544c-4413-98e7-e7294918d8b6","resolution":{"observed_at":"2026-08-15T20:13:00.218998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02391","last_updated":"2024-04-11T16:29:12Z","snapshot_observed_at":"2026-08-14T18:28:08.696867Z","submitted_at":"2023-10-03T19:24:24Z","title":"SE(3)-Stochastic Flow Matching for Protein Backbone Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02391","snapshot_observed_at":"2026-08-15T20:13:00.225162Z","title":"Se (3)-stochastic flow matching for protein backbone generation.arXiv preprint arXiv:2310.02391, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.225162Z"},"links":{"cited_paper":"/paper/2310.02391","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:b544b2431432c0d489338c7691db9783c1919ddab512bb62a722ed049b9f3b9c","observation_id":"6cc5feda-359b-423e-9737-d00e0c3f5221","resolution":{"observed_at":"2026-08-15T20:13:00.225162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-08-13T14:17:14.773831Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-15T20:13:00.230392Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling.arXiv preprint arXiv:2209.14548, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.230392Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:4a800f48ac114afa575b24b4684e8aecd21a2da0aca7bbb00f244b11475e63e4","observation_id":"9c287922-e198-44e5-8940-a6a508c11558","resolution":{"observed_at":"2026-08-15T20:13:00.230392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.234827Z","title":"Neural ordinary differential equations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.234827Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:1fee4e3350e254b07c8096655f3316f5d2c0ea3fc900a875b178f7e7786965b2","observation_id":"ef08daae-3b0b-4451-8425-2ea98617bb5b","resolution":{"observed_at":"2026-08-15T20:13:00.234827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.239064Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, page 02783649241273668, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.239064Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:5f760109a97427a6cd5948b6c56ef1f6c4f7a125a3b285f5c13fe59c396d1e3c","observation_id":"31978adb-d075-48f7-854b-74808710fc45","resolution":{"observed_at":"2026-08-15T20:13:00.239064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.243560Z","title":"Diffusion models beat gans on image synthesis.Advances in neural information processing systems, 34:8780–8794, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.243560Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:06a7ac5aa8a86a7402945fd6312540a7afb60885c929eab9a2a18af3e462900b","observation_id":"e6a40291-4d40-46d6-9601-55cf0b6294b0","resolution":{"observed_at":"2026-08-15T20:13:00.243560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16173","last_updated":"2024-12-16T15:42:46Z","snapshot_observed_at":"2026-08-12T23:58:11.221218Z","submitted_at":"2024-05-25T10:45:46Z","title":"Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16173","snapshot_observed_at":"2026-08-15T20:13:00.248611Z","title":"Diffusion- based reinforcement learning via q-weighted variational policy optimization.arXiv preprint arXiv:2405.16173, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.248611Z"},"links":{"cited_paper":"/paper/2405.16173","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:bac71f6c6c1adb82b6b0cd18b44a88a64cb35c523d96f5b5204bb691eaeb6f7c","observation_id":"37f1818f-1dcf-4766-a046-14487dd8c0bd","resolution":{"observed_at":"2026-08-15T20:13:00.248611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16984","last_updated":"2024-03-14T19:28:48Z","snapshot_observed_at":"2026-08-13T10:02:35.492082Z","submitted_at":"2023-09-29T05:05:54Z","title":"Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16984","snapshot_observed_at":"2026-08-15T20:13:00.253038Z","title":"Consistency models as a rich and efficient policy class for reinforcement learning.arXiv preprint arXiv:2309.16984, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.253038Z"},"links":{"cited_paper":"/paper/2309.16984","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:a0f39a07923a10c0bd3fdfa09f67630e7c6d6a4ecc1a94d39ed668390b317651","observation_id":"2d9509c2-c3b1-49a4-a133-df57efb2fe73","resolution":{"observed_at":"2026-08-15T20:13:00.253038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06061","last_updated":"2025-02-09T22:45:15Z","snapshot_observed_at":"2026-08-09T18:00:02.961549Z","submitted_at":"2025-02-09T22:45:15Z","title":"Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06061","snapshot_observed_at":"2026-08-15T20:13:00.257162Z","title":"Online reward-weighted fine-tuning of flow matching with wasserstein regularization.arXiv preprint arXiv:2502.06061, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.257162Z"},"links":{"cited_paper":"/paper/2502.06061","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:92e6fa8524ad2f84c7373564848e613748bb4ad990f683a081ed4cc53a5d71f9","observation_id":"d02ead63-07d8-4762-a248-384541f0024a","resolution":{"observed_at":"2026-08-15T20:13:00.257162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.261156Z","title":"A minimalist approach to offline reinforcement learning.Advances in neural information processing systems, 34:20132–20145, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.261156Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:ee9fb008c5ba7fc5b41f11cc8fd62622f04bc8e52dfd4d9c719b558202ff76ca","observation_id":"15083ea9-9872-4702-8804-b9f3787aad9a","resolution":{"observed_at":"2026-08-15T20:13:00.261156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.264659Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.264659Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:12ff9513cde389149e6d1cc68cea73bcbff3050731c0a12faf427616dab37cbc","observation_id":"1c959ac2-172f-4f83-9b2e-2015d712f9af","resolution":{"observed_at":"2026-08-15T20:13:00.264659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.268177Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.268177Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:5e962ea69f959096428e8ef58cc981ae2bbdb64a4d6d5c4895e5a66104ca788b","observation_id":"66c705be-1d97-4367-a78f-dbb4d2de7100","resolution":{"observed_at":"2026-08-15T20:13:00.268177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-15T20:13:00.271871Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.271871Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:57e4f3fc3e5e4fb733512a63da028dde9c2f5ace1afe8a3b535bd0d2b7d32e01","observation_id":"e3827596-99a4-4a14-9fce-efbbcb812d70","resolution":{"observed_at":"2026-08-15T20:13:00.271871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05333","last_updated":"2024-02-28T13:48:09Z","snapshot_observed_at":"2026-08-14T19:16:27.834636Z","submitted_at":"2023-10-09T01:29:17Z","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05333","snapshot_observed_at":"2026-08-15T20:13:00.275799Z","title":"Diffcps: Diffusion model based constrained policy search for offline reinforcement learning.arXiv preprint arXiv:2310.05333, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.275799Z"},"links":{"cited_paper":"/paper/2310.05333","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:e3f3f90764692e4773bbd8b85868c9b1f1b2bc71523fe5838a484b897be26cac","observation_id":"5f9fb3e0-761f-4815-824b-d8207e8b40d6","resolution":{"observed_at":"2026-08-15T20:13:00.275799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.279335Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.279335Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:5301121f5815c0bbdd48f8f34db5dd11a6a6595da65246df1b01e98f09bb8abe","observation_id":"ae535516-f9c2-4d21-8c61-7b6ce41b57c3","resolution":{"observed_at":"2026-08-15T20:13:00.279335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04845","last_updated":"2024-09-02T22:43:33Z","snapshot_observed_at":"2026-08-13T04:24:17.587271Z","submitted_at":"2024-02-07T13:44:47Z","title":"AlphaFold Meets Flow Matching for Generating Protein Ensembles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04845","snapshot_observed_at":"2026-08-15T20:13:00.282865Z","title":"Alphafold meets flow matching for generating protein ensembles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.282865Z"},"links":{"cited_paper":"/paper/2402.04845","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:c3b0a43f0cba09f0bafa99efad33b704a397454aba75b5580e4e8561b1e111b7","observation_id":"a4b4f240-ded0-4118-bfef-25dae157c7d9","resolution":{"observed_at":"2026-08-15T20:13:00.282865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.834983Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"4273c5b0-1060-4a73-b1b6-253354b5547f","year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.286738Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:9acb8c56f552ccd7636184e6a27853cba496860b9297506b592bb6431aa004a1","observation_id":"eee6799d-6930-46f9-bf39-28a7b8d6d488","resolution":{"observed_at":"2026-08-15T20:13:00.838771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-15T20:13:00.291276Z","title":"Offline reinforcement learning with implicit q-learning.arXiv preprint arXiv:2110.06169, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.291276Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:2c3265199fec45e151b8101abdb8b80b16ddcc4a2e431aaf8b235d5e48a2fbc5","observation_id":"b2ecf5d1-dff0-4a92-87bb-79fa9c817978","resolution":{"observed_at":"2026-08-15T20:13:00.291276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.822076Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"38e304e6-b5cb-4df7-a50b-297a6b8ab8e0","year":2019},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.295541Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:7458729da488b718b885ab7013201d1cae5fb1aefe61a18329e3b94478e0e799","observation_id":"ff883579-478f-462f-85f6-075c11acc940","resolution":{"observed_at":"2026-08-15T20:13:00.826534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T20:13:00.299421Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.299421Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:540bdcaf56340d4913ff8d78908880a8fe8bcc0ff9c7da7f957078bf8c5f6529","observation_id":"5767e56e-2700-4e23-ab8c-2e2619586369","resolution":{"observed_at":"2026-08-15T20:13:00.299421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-15T20:13:00.304223Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.304223Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:2f0b0a4a29c47fb2da8c6dd0120cc27a2007f99cfd4ffa6e9b0b6a16a8def6b3","observation_id":"5f5ddba2-7544-404d-8157-2145da7564d2","resolution":{"observed_at":"2026-08-15T20:13:00.304223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-15T20:13:00.308765Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.308765Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:e4d6465139e66a0d69b8d7de4d6e39b60fc07007cb05bb1a9403803be1a1930e","observation_id":"16d2fc83-3023-49ca-9ec2-322a9f364cbf","resolution":{"observed_at":"2026-08-15T20:13:00.308765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.312759Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.312759Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:1a02f77cd8578e900af50663d653bc11f7dd6301f5269032901a4e314e360363","observation_id":"5559add1-5eab-4a63-a9f3-207b008c0301","resolution":{"observed_at":"2026-08-15T20:13:00.312759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18520","last_updated":"2024-05-28T18:38:46Z","snapshot_observed_at":"2026-08-12T23:55:48.995077Z","submitted_at":"2024-05-28T18:38:46Z","title":"Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18520","snapshot_observed_at":"2026-08-15T20:13:00.316738Z","title":"Offline-boosted actor-critic: Adaptively blending optimal historical behaviors in deep off-policy rl.arXiv preprint arXiv:2405.18520, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.316738Z"},"links":{"cited_paper":"/paper/2405.18520","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:783838259a10320e78a6427d9dcb06b4dc38805485f0cc2654c6581793be1fdd","observation_id":"05275907-e1bd-401e-ba72-8a83ef446b96","resolution":{"observed_at":"2026-08-15T20:13:00.316738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20109","last_updated":"2024-10-31T06:16:24Z","snapshot_observed_at":"2026-08-15T05:57:28.049034Z","submitted_at":"2024-07-29T15:36:42Z","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20109","snapshot_observed_at":"2026-08-15T20:13:00.320535Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning.arXiv preprint arXiv:2407.20109, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.320535Z"},"links":{"cited_paper":"/paper/2407.20109","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:e906323128cb061abc55db26cd670def492a9ae879a07e2a96a70d01cb73ef02","observation_id":"451216f4-161f-49d8-b82f-54a353574301","resolution":{"observed_at":"2026-08-15T20:13:00.320535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.324469Z","title":"Self-imitation learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.324469Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:1ce60ddd575f3818bcc866573c2120f7d22b70189f77f045364a12cf9fcff412","observation_id":"b5f19a43-4b22-43f6-9662-5bb718a1ff0d","resolution":{"observed_at":"2026-08-15T20:13:00.324469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.793201Z","title":"The difficulty of passive learning in deep reinforcement learning","venue":null,"work_id":"07c4530e-1be2-4a11-b7b4-d4015c80acec","year":2021},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.327981Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:3c96a703a8a50ece4b89b2ecd72463f1d4e6b0aedd6de1bd1a33de7d40b96da5","observation_id":"e6664bdf-b841-4192-9764-287892c1f78d","resolution":{"observed_at":"2026-08-15T20:13:00.797418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09329","last_updated":"2024-10-28T23:33:19Z","snapshot_observed_at":"2026-08-16T05:57:16.312737Z","submitted_at":"2024-06-13T17:07:49Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09329","snapshot_observed_at":"2026-08-15T20:13:00.331493Z","title":"Is value learning really the main bottleneck in offline rl? arXiv preprint arXiv:2406.09329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.331493Z"},"links":{"cited_paper":"/paper/2406.09329","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:5e9da053611c3bf705d7abc7755d002354df0cbc3dcb13e587447509e72a8f2c","observation_id":"4c089d76-81fb-4215-aa34-7ef7fee7e4dd","resolution":{"observed_at":"2026-08-15T20:13:00.331493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-12T18:03:00.749482Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-08-15T20:13:00.335423Z","title":"Flow q-learning.arXiv preprint arXiv:2502.02538, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.335423Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:a4150c45c8bb60e49ed06576cff3361ec407e71c5f94f5b8c624e7faf340649e","observation_id":"b5376564-e237-4d21-84e6-5269287a3572","resolution":{"observed_at":"2026-08-15T20:13:00.335423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-15T20:13:00.339230Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.339230Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:243c75be79189c804501cda6b4a092bd74ae07c41a4cf7bdff34551ea58c3428","observation_id":"7b82270a-0f0d-4c66-a73e-b4ae207c82f3","resolution":{"observed_at":"2026-08-15T20:13:00.339230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.343045Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.343045Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:e54a76ef16b1c6db6d83b551099ed4ca49b19a9dc3611f9471e8f5587cd4d73a","observation_id":"4fa8bec0-d654-4340-9d63-c84b28a59fbd","resolution":{"observed_at":"2026-08-15T20:13:00.343045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-13T04:59:02.679984Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-15T20:13:00.346736Z","title":"Learning a diffusion model policy from rewards via q-score matching.arXiv preprint arXiv:2312.11752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.346736Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:91b9363e92a67b18df4a9f6f90b70972ff7c8eb24b731573b81d0d5ebc7cf6bb","observation_id":"3724894e-8df1-46c4-b523-f13dc4af0a9a","resolution":{"observed_at":"2026-08-15T20:13:00.346736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-15T20:13:00.350660Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.350660Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:a1393a900f6b4921f0063dfb0304bc7d958cc75954934c114195898a1da94fc2","observation_id":"9e9e0f0b-acce-4343-af7e-f9f6d3418e63","resolution":{"observed_at":"2026-08-15T20:13:00.350660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-16T06:39:37.314463Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-15T20:13:00.354763Z","title":"Humanoidbench: Simulated humanoid benchmark for whole-body locomotion and manipulation.arXiv preprint arXiv:2403.10506, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.354763Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:13ad06672261b0d37c4b5ef07162c483857d711745b5b51854d618ea31e2fb54","observation_id":"84c40c83-3c3b-49ea-acb3-7b3e3307e811","resolution":{"observed_at":"2026-08-15T20:13:00.354763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.773928Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"b354b56a-0193-4ffa-a682-b3934846598b","year":2014},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.358447Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:eb5e06e745380fa85c8df24f665bdd59b011fac564743479f6545ce822418222","observation_id":"df987991-127d-473b-a2b7-c300bbf8f0a8","resolution":{"observed_at":"2026-08-15T20:13:00.777805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-15T20:13:00.362097Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.362097Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:4f1c135ba442f73a025b9f160ecb2a223b2481c5718c00a650c44548c0c15bf5","observation_id":"6191128b-e248-4af0-99fa-4a7ef1b68612","resolution":{"observed_at":"2026-08-15T20:13:00.362097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.761569Z","title":"Reinforcement learning.Journal of Cognitive Neuroscience, 11(1): 126–134, 1999","venue":null,"work_id":"bc26b3fd-60b1-467d-827a-c7049731de60","year":1999},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.365717Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:5346466c6c685381786ff8904202021170f4a3a10483720eb984972d1fa5e33d","observation_id":"22bb8b3c-75fa-437c-b6aa-14c2b38539ab","resolution":{"observed_at":"2026-08-15T20:13:00.765713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T20:13:00.369356Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.369356Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:68b016a0065e34cb2ba9dbbedf31cc21525f2603c991da35e420c7c1ef4c916f","observation_id":"ca32db8c-638b-4247-8b9d-8dbecc0ca744","resolution":{"observed_at":"2026-08-15T20:13:00.369356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-15T20:13:00.373204Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.373204Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:90fcdb937654d0f6219cedc28fd43041ee0b10009d3b29b18c9ae67254a24abb","observation_id":"bd1637be-3421-46af-80c1-20a836495baa","resolution":{"observed_at":"2026-08-15T20:13:00.373204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.377185Z","title":"Springer, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.377185Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:3e80510107f12f6385f5796feebc3bd2e1837654373ec36608a0dd41fc916c10","observation_id":"bc033cc0-5e72-42ef-a15e-3b9b41de0543","resolution":{"observed_at":"2026-08-15T20:13:00.377185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:00.738243Z","title":"Diffusion actor-critic with entropy regulator.Advances in Neural Information Processing Systems, 37:54183–54204, 2024","venue":null,"work_id":"5b162936-7134-4bbf-bd39-58901e5ddbf4","year":2024},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.380879Z"},"links":{"citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:7920e7b6017f2cac3726ff1a46a756f297c66c9cafd0686f51f0a586c5624778","observation_id":"39b9530c-34af-4332-a469-378be282eb02","resolution":{"observed_at":"2026-08-15T20:13:00.744527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-08-12T13:12:28.417467Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-15T20:13:00.385359Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.385359Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:d5659d146e7986cc868848c543c8f235a8b768d4da9984d07d1276978e50b9ab","observation_id":"43cc9353-aed6-4360-8a61-8545b6fe35fa","resolution":{"observed_at":"2026-08-15T20:13:00.385359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-14T00:44:20.363356Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-15T20:13:00.389144Z","title":"Policy representation via diffusion probability model for reinforcement learning.arXiv preprint arXiv:2305.13122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.389144Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:6015e74aac0a63a18392f57d73321ee029227cd9ae68463ac73920a748b026d9","observation_id":"12bff938-c31d-4619-9847-279cfb70f603","resolution":{"observed_at":"2026-08-15T20:13:00.389144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04975","last_updated":"2025-03-06T21:10:12Z","snapshot_observed_at":"2026-08-14T23:35:11.392653Z","submitted_at":"2025-03-06T21:10:12Z","title":"Energy-Weighted Flow Matching for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04975","snapshot_observed_at":"2026-08-15T20:13:00.393031Z","title":"Energy-weighted flow matching for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.393031Z"},"links":{"cited_paper":"/paper/2503.04975","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:0b2136ff6919a7ddf8f4ca74070fc7f620468502de080fb353936af8bed23201","observation_id":"f9093019-2300-4f7a-b23c-d42f708e8bf6","resolution":{"observed_at":"2026-08-15T20:13:00.393031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T05:08:58.560220Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 5 inbound Pith citation observations for arXiv:2506.12811."}