{"as_of":"2026-08-15T17:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61a935390c1461e73c6d8f29a26982dcd4296557b312745eb24b3bb187c26497","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:20:42.023257Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20350/citation-record","integrity":"/paper/2505.20350/integrity","json":"/paper/2505.20350/citation-record.json","paper":"/paper/2505.20350"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:35.794468Z","title":"Diffusion policies for out-of-distribution generalization in offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.794468Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8c74908246f0a91ce20074b5b107469796630157b0053366c9ec381a30dfee80","observation_id":"7bb54068-3566-43d6-9ef6-5368890198c5","resolution":{"observed_at":"2026-08-07T14:20:35.794468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-07T14:20:35.841381Z","title":"Is conditional generative modeling all you need for decision-making? arXiv preprint arXiv:2211.15657, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.841381Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:bc7357cbd96188a21664550dbaf2a9919ef7a69c1982056e6213a7e64530d06c","observation_id":"f119d52d-6872-42d2-8739-dad7a8a1e273","resolution":{"observed_at":"2026-08-07T14:20:35.841381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11096","last_updated":"2023-01-30T11:28:55Z","snapshot_observed_at":"2026-08-14T15:17:33.744909Z","submitted_at":"2022-11-20T21:57:10Z","title":"Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11096","snapshot_observed_at":"2026-08-07T14:20:35.925222Z","title":"Let offline rl flow: Training conservative agents in the latent space of normalizing flows","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.925222Z"},"links":{"cited_paper":"/paper/2211.11096","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f02438afb6edf2f832466353a4c1cf26ed726ffe57d3138f57d20027da8ea131","observation_id":"de253d64-9fad-452f-b44c-a5243b4d6ea9","resolution":{"observed_at":"2026-08-07T14:20:35.925222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:35.996839Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:35.996839Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:90d9592c35add3bf2b8a41b43b9a9f9dde69a104c18c306d552aac9dd0b4102e","observation_id":"0f129e7f-1e58-4fca-a9d3-2fb211336e0d","resolution":{"observed_at":"2026-08-07T14:20:35.996839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05556","last_updated":"2021-03-17T17:22:51Z","snapshot_observed_at":"2026-08-14T03:08:55.083354Z","submitted_at":"2020-08-12T20:06:52Z","title":"Model-Based Offline Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05556","snapshot_observed_at":"2026-08-07T14:20:36.027635Z","title":"Model-based offline planning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.027635Z"},"links":{"cited_paper":"/paper/2008.05556","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:81beccf241631f5f1214b6c852c178761b6d61c6efc785531a5f5c2ad8bdf842","observation_id":"b4df2d69-3fe9-4ec9-81b5-adf5c3b19d50","resolution":{"observed_at":"2026-08-07T14:20:36.027635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:36.087639Z","title":"The peano-baker series","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.087639Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:db095d2a966865ba89713b27b9f26ef0bdbfb16b4932f36ca30e5d3fe326b39d","observation_id":"0efb84d6-7b3e-45e6-ad7b-bd796887085b","resolution":{"observed_at":"2026-08-07T14:20:36.087639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-13T16:35:23.206237Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-07T14:20:36.145203Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.145203Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:06dfc4399f2aba3ec4f34f12115d372fc035a9d1c1e3954421319ff3319b9f69","observation_id":"f669e893-c37a-4c18-aedb-6dc3c9e72cc4","resolution":{"observed_at":"2026-08-07T14:20:36.145203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T14:20:36.208602Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.208602Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c6c205990b684dc9cb64940e0c67103054f007f5d0e2c582b494b963e28519ca","observation_id":"84d6bdb3-f2f8-4b43-b4c0-e1357b662ae1","resolution":{"observed_at":"2026-08-07T14:20:36.208602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:20:36.260626Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.260626Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d9afcfe0238c81d32500d60f5e789bb217c3a02b67a223a1a9fc6d8a651d8c37","observation_id":"348dc640-46d7-4a64-9952-8c7840faa9e3","resolution":{"observed_at":"2026-08-07T14:20:36.260626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14328","last_updated":"2025-02-24T06:26:55Z","snapshot_observed_at":"2026-08-13T10:26:02.588657Z","submitted_at":"2023-08-28T06:15:14Z","title":"Reinforcement Learning for Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":"2308.14328","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14328","snapshot_observed_at":"2026-08-07T14:20:43.822408Z","title":"Reinforcement Learning for Generative AI: A Survey","venue":"cs.LG","work_id":"adf442df-ff98-454f-9427-4665bc5db4e1","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.325840Z"},"links":{"cited_paper":"/paper/2308.14328","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:509c9bde31beada64f542320e1be0842aafca1a7d1d68eb98db502dfc3aabaa9","observation_id":"7bcaa2fe-154a-4da1-8370-bcc01f7a57c5","resolution":{"observed_at":"2026-08-07T14:20:43.903572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-13T04:48:38.528534Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-07T14:20:36.384955Z","title":"Simple hierarchi- cal planning with diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.384955Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:50c624cd0156fd539b4e0cba8cfb8f041c75090e3cc19924ca0fc0b204783012","observation_id":"820a9767-3a44-4d6b-9503-ab3a35904761","resolution":{"observed_at":"2026-08-07T14:20:36.384955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-08-13T14:17:14.773831Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-07T14:20:36.514447Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.514447Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d8c77923e86815b70230381bb0bb6f206fbb5d0849b872f73f6457e38b2b69eb","observation_id":"ad21c487-7e76-4c69-aab3-0e6db50e2a36","resolution":{"observed_at":"2026-08-07T14:20:36.514447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13777","last_updated":"2024-05-26T00:23:47Z","snapshot_observed_at":"2026-08-15T10:27:58.428315Z","submitted_at":"2024-02-21T12:54:48Z","title":"Deep Generative Models for Offline Policy Learning: Tutorial, Survey, and Perspectives on Future Directions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13777","snapshot_observed_at":"2026-08-07T14:20:36.669857Z","title":"Deep generative models for offline policy learning: Tutorial, survey, and perspectives on future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.669857Z"},"links":{"cited_paper":"/paper/2402.13777","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:75afb479d0860320a3602aff08f008f1f93539eeae49c708fbff8f089c00e60c","observation_id":"7bbc88ad-efbd-4cf0-9dda-be2de6e039af","resolution":{"observed_at":"2026-08-07T14:20:36.669857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:36.788091Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.788091Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f428499fb19f72f1d4c53be411f953b3ad388dcd12a1f3be883e145b01dee79d","observation_id":"3c723759-4267-4c73-ac31-05085568bd52","resolution":{"observed_at":"2026-08-07T14:20:36.788091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-07T14:20:36.878337Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.878337Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:eaf6ff0182936853b5b6ea7de1903fe507fd9a56f57fca781a0fcaefd826f222","observation_id":"2278a0db-9356-4ad5-bd8a-7920cd691edf","resolution":{"observed_at":"2026-08-07T14:20:36.878337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08698","last_updated":"2023-07-17T17:57:56Z","snapshot_observed_at":"2026-08-14T01:11:52.868613Z","submitted_at":"2023-07-17T17:57:56Z","title":"Flow Matching in Latent Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08698","snapshot_observed_at":"2026-08-07T14:20:36.912260Z","title":"Flow matching in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.912260Z"},"links":{"cited_paper":"/paper/2307.08698","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6b0ccf4ff5cb5ce986b037e79feaaf4f3e9a2873aed67316f0898e936aa63eeb","observation_id":"db435bce-f951-41d5-9933-609c4375bfae","resolution":{"observed_at":"2026-08-07T14:20:36.912260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:36.964361Z","title":"Fisher flow matching for generative modeling over discrete data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:36.964361Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8c52d72494764cc907805db9bd7d67da1fe6d6037299bfab2d23669387c34dcc","observation_id":"db110ff5-eb32-42fb-b950-82196006e03a","resolution":{"observed_at":"2026-08-07T14:20:36.964361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16173","last_updated":"2024-12-16T15:42:46Z","snapshot_observed_at":"2026-08-12T23:58:11.221218Z","submitted_at":"2024-05-25T10:45:46Z","title":"Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16173","snapshot_observed_at":"2026-08-07T14:20:37.020291Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.020291Z"},"links":{"cited_paper":"/paper/2405.16173","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d2c544b6cc51d5904121c79c1c6c7060d68dde2712a2ceb6d6b1194960168810","observation_id":"de1150a3-cfae-485b-a4eb-b33f5c0b678b","resolution":{"observed_at":"2026-08-07T14:20:37.020291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15443","last_updated":"2024-10-25T03:36:07Z","snapshot_observed_at":"2026-08-15T13:23:16.917305Z","submitted_at":"2024-01-27T15:30:49Z","title":"DiffuserLite: Towards Real-time Diffusion Planning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15443","snapshot_observed_at":"2026-08-07T14:20:37.065822Z","title":"Diffuserlite: Towards real-time diffusion planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.065822Z"},"links":{"cited_paper":"/paper/2401.15443","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:2de5a1ac788e53a52e4ebb2c879ebf51a85be82f8939cb6f364bee6bca1d7521","observation_id":"738948f2-c8df-4a37-bca2-b4a02c58691d","resolution":{"observed_at":"2026-08-07T14:20:37.065822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.130184Z","title":"Probabilistic number theory I: Mean-value theorems, volume 239","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.130184Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3f1d24888ae9660a8be520a8e7650d266f804946c788f29a3204f4ada22e9e6f","observation_id":"96595d25-2083-4c04-a978-81d105de798d","resolution":{"observed_at":"2026-08-07T14:20:37.130184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.190416Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.190416Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:639c8d592aa37923eb03e13a1935610c06aea32abd09e79f3a1008334184fc11","observation_id":"25e213c1-9081-4b08-b16a-346397d1a105","resolution":{"observed_at":"2026-08-07T14:20:37.190416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.230498Z","title":"A reinforcement learning diffusion decision model for value-based decisions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.230498Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6ffe59f925e18799dc74cc92581cf22336c6204b2435161f98c2004bb09d1b66","observation_id":"e0ada8b7-b884-46c2-a7b3-cd3f3d362923","resolution":{"observed_at":"2026-08-07T14:20:37.230498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.281105Z","title":"Reinforcement learning for generative ai: State of the art, opportunities and open research challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.281105Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:60c253709ce96358cfda7f93521d6c026b6947b465a7a2ad97ceca2f7d947ae8","observation_id":"4e7cf567-5aba-4e08-8562-5dae2e2047e3","resolution":{"observed_at":"2026-08-07T14:20:37.281105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-14T04:09:47.636898Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T14:20:37.372971Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.372971Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ef3eb55bf845b49e01558fcf69083e23c4282a4b0a7ec63e23c66048beba51b6","observation_id":"9af8a4e9-a85c-4332-b706-7a7bec547408","resolution":{"observed_at":"2026-08-07T14:20:37.372971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.438497Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.438497Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:1266e4f75f88183eaf3635fd72a7c7cb188bd2a9e2bee725ec7d522636b1885d","observation_id":"9a03472b-99bd-44ef-9143-fee30503e1db","resolution":{"observed_at":"2026-08-07T14:20:37.438497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.510693Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.510693Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c827312c37a631c70c3b67781a3bba77aef9b59dcdcc60aa5bf352462fdb0fb0","observation_id":"e125cbdf-408d-4e94-88ba-db8bc3189dc0","resolution":{"observed_at":"2026-08-07T14:20:37.510693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-08-13T17:30:38.052991Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-07T14:20:37.550897Z","title":"Generalized decision transformer for offline hindsight information matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.550897Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:5df33337cb462c027af872ab3ae15a89eb2d3e264e889f711e79832e5581b22b","observation_id":"d953dd6a-2031-45a3-9913-27c10a576f89","resolution":{"observed_at":"2026-08-07T14:20:37.550897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-15T14:28:08.719865Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-08-07T14:20:37.619351Z","title":"Behavior-regularized diffusion policy optimization for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.619351Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:1ebd5572cba9b778f4ca0406da2affed1ef4aca47ce016f940da93591695fdfd","observation_id":"2dff5418-ebe0-492d-be11-b3819b4cd23c","resolution":{"observed_at":"2026-08-07T14:20:37.619351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.684967Z","title":"Discrete flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.684967Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:9bc927e48dda845a50f170690f57bea8fa34740aa3c24c84148dd701043631f1","observation_id":"2206e9e9-7177-4d91-8879-450d1184d261","resolution":{"observed_at":"2026-08-07T14:20:37.684967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.741192Z","title":"Offline rl policies should be trained to be adaptive","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.741192Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7167c07b608b1f07f8072a7456cd8ae135ea2d200e4766f2de8729ddfa4e0d1a","observation_id":"d631f224-5059-4175-9157-3e54022fb3d9","resolution":{"observed_at":"2026-08-07T14:20:37.741192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.793878Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.793878Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:cd47310405a9e6c20edc9a952afae553be72397d2978ff92740f79711e984dfb","observation_id":"a5047400-14cb-44ea-968e-41a56053beaf","resolution":{"observed_at":"2026-08-07T14:20:37.793878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T14:20:37.857764Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.857764Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d8ef6f4a61e02a82d1f49985ce18c192ea93f691e811a3ec8fef5cf583c69bfb","observation_id":"51eff6bf-9a58-4084-b442-0edb90f51bf6","resolution":{"observed_at":"2026-08-07T14:20:37.857764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.931785Z","title":"Diffusion model is an effective planner and data synthesizer for multi-task reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.931785Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:1a14cfffe458783163017d1e85ad63e2d8a6cc256794cdc98d80ba148aadf356","observation_id":"56f6ab40-9ae6-4d94-a4f1-86474d6ada37","resolution":{"observed_at":"2026-08-07T14:20:37.931785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:37.998904Z","title":"Lectures on Lipschitz analysis","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.998904Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6e964adff9d1d2d3f0d802f4bb7d953fba3f1b5447f1c3f4ded4bdab9a28ee8f","observation_id":"45995f37-337d-4382-bcb8-5e9c76826337","resolution":{"observed_at":"2026-08-07T14:20:37.998904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.209858Z","title":"Flow++: Improving flow-based generative models with variational dequantization and architecture design","venue":null,"work_id":"16aae5dc-b9db-4c69-a47f-387a5db21f73","year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.069389Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:742fee3fddc474665166cc2e411a4b8a8a0a1c5d2fda8ed1ee504810464b1bdf","observation_id":"a942017a-8f99-480c-bb0a-77b6a401fe28","resolution":{"observed_at":"2026-08-07T14:20:46.278627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04875","last_updated":"2023-06-08T02:12:26Z","snapshot_observed_at":"2026-08-13T11:22:10.946008Z","submitted_at":"2023-06-08T02:12:26Z","title":"Instructed Diffuser with Temporal Condition Guidance for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04875","snapshot_observed_at":"2026-08-07T14:20:38.121882Z","title":"Instructed diffuser with temporal condition guidance for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.121882Z"},"links":{"cited_paper":"/paper/2306.04875","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ee578ba259bedf6981610c1c247bbe03435e2d0a6ea8f0116dd7a120ccf97745","observation_id":"20f550fd-9574-465a-818a-2a7c68710f0b","resolution":{"observed_at":"2026-08-07T14:20:38.121882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14164","last_updated":"2023-01-20T04:18:43Z","snapshot_observed_at":"2026-08-13T13:13:11.962592Z","submitted_at":"2022-12-29T03:15:59Z","title":"On Transforming Reinforcement Learning by Transformer: The Development Trajectory","version":2},"cited_work":{"arxiv_id":"2212.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.14164","snapshot_observed_at":"2026-08-07T14:20:43.377959Z","title":"On Transforming Reinforcement Learning by Transformer: The Development Trajectory","venue":"cs.LG","work_id":"7656931b-35ed-44bb-8c33-4ffb1094261e","year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.165967Z"},"links":{"cited_paper":"/paper/2212.14164","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7dcd6e9ff8042b39679216a8cb9301d091161025283171cddcb2b77bf20de184","observation_id":"a05039dd-c937-4793-acdb-53693627ce24","resolution":{"observed_at":"2026-08-07T14:20:43.445599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03747","last_updated":"2023-03-07T09:10:34Z","snapshot_observed_at":"2026-08-13T12:30:03.660339Z","submitted_at":"2023-03-07T09:10:34Z","title":"Graph Decision Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03747","snapshot_observed_at":"2026-08-07T14:20:38.225712Z","title":"Graph decision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.225712Z"},"links":{"cited_paper":"/paper/2303.03747","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:4f0230e6478caf01bf30c5f4768a5be4fb3b22282a5faf7694dfd8be7c144a0a","observation_id":"b280403c-910d-4944-adf1-5da6f0f07d93","resolution":{"observed_at":"2026-08-07T14:20:38.225712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:46.067112Z","title":"Adaflow: Imitation learning with variance- adaptive flow-based policies","venue":null,"work_id":"014dfc8f-0c4e-4ce9-9a32-d347d6c61a38","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.289200Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:e996cfd3fd57dec2cff397d79d52c90d568976e7767b22e96297e298c1ca9733","observation_id":"f3e6866e-bb55-41c4-947e-cd9b8066ff5e","resolution":{"observed_at":"2026-08-07T14:20:46.112420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.947992Z","title":"Diffusion models as optimizers for efficient planning in offline rl","venue":null,"work_id":"90ce583e-9738-4fb7-8443-f5be62dcf240","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.338249Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:68d54f2667e5b6ac736c0341b1ad61953371ef0e91d1c5212dd56db2b0101c56","observation_id":"ede41e49-49ce-4c59-8bfd-0440c2f19fb2","resolution":{"observed_at":"2026-08-07T14:20:46.003051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.804921Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":"aa27056f-1dd0-43e7-8939-7dd7aa41cacc","year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.382943Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7df449ee8670b30cdd2b6bac7038e93812bc50df1ba772e978e5d2ce6e80a837","observation_id":"f402d366-30cd-4120-8488-c0978b239947","resolution":{"observed_at":"2026-08-07T14:20:45.883231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-07T14:20:38.445055Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.445055Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:014ea8bbd5e04c3a01644703d2f0b946ff212cc8e85464d249a30fceaf6f4c52","observation_id":"cecf9b24-9199-4a7a-a826-8c0511ff1539","resolution":{"observed_at":"2026-08-07T14:20:38.445055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10291","last_updated":"2023-01-24T11:09:30Z","snapshot_observed_at":"2026-08-13T14:41:00.955866Z","submitted_at":"2022-08-22T13:19:02Z","title":"Efficient Planning in a Compact Latent Action Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10291","snapshot_observed_at":"2026-08-07T14:20:38.497294Z","title":"Efficient planning in a compact latent action space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.497294Z"},"links":{"cited_paper":"/paper/2208.10291","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:382c71ca82ddd64b47e8c4301b6ac24e65c014d90496e1330e68ea4462227f75","observation_id":"4861505a-1e2d-487c-a132-c445086446ce","resolution":{"observed_at":"2026-08-07T14:20:38.497294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.547205Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.547205Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8f5500322ff5dd0a943e9ea0982ac05e2ddd66a520ce16d9d50686328e4f88c9","observation_id":"2d8098ab-c4e2-459f-9614-4cfac6062659","resolution":{"observed_at":"2026-08-07T14:20:38.547205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.677681Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"a8fda12d-5475-4414-a6e6-151df49b3554","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.624432Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:2104a9514b4667a42ef9feb660fcf45148253331a38b5a8cb09acd40db3d83c1","observation_id":"eb7e562b-9b99-433e-b89a-5d65b1f14354","resolution":{"observed_at":"2026-08-07T14:20:45.709405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.689398Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.689398Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:80d8e7ce6494108ce4ddb5f2a85f9c05ba3e2b5ce76ec96c88df4b7c820c772c","observation_id":"147e7268-7bad-41a7-84cd-ca58fb1e5aa2","resolution":{"observed_at":"2026-08-07T14:20:38.689398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T14:20:38.742099Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.742099Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:3625a79b17d8453431314812adb530c5f459ec45d261d49f18e13757374ece99","observation_id":"aade2317-0a92-436b-a2d0-33ca8966987f","resolution":{"observed_at":"2026-08-07T14:20:38.742099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.799102Z","title":"Stabilizing off- policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.799102Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:39a94507c452e247bd96cd66ca1219898a43a500c0c5c69c610d95c8257338f1","observation_id":"bb3f2554-6bce-47e0-a4e2-e4fbd730a15e","resolution":{"observed_at":"2026-08-07T14:20:38.799102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:38.842872Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.842872Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:650974c8bd06179a7e7985233a5787807d031361ddabf85ab3cf782982f1b9f7","observation_id":"913dcc55-4788-431b-bf37-de8794841bb8","resolution":{"observed_at":"2026-08-07T14:20:38.842872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T14:20:38.891334Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.891334Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:86b8a4e4e60b2aaeb7e4badcee7e8701da384eb5225251d424bdf142b9d0f83f","observation_id":"d507ba1f-1aec-4ef2-b44b-8ca0ebbcad97","resolution":{"observed_at":"2026-08-07T14:20:38.891334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02439","last_updated":"2024-02-22T00:05:12Z","snapshot_observed_at":"2026-08-14T19:57:56.762214Z","submitted_at":"2024-02-04T10:30:23Z","title":"DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02439","snapshot_observed_at":"2026-08-07T14:20:38.939358Z","title":"Diffstitch: Boosting offline reinforcement learning with diffusion-based trajectory stitching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.939358Z"},"links":{"cited_paper":"/paper/2402.02439","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:17f63e6f3bf4b5a89f9d03282ba9d358800d8c849f0afa7084c29ba8da938245","observation_id":"4c22e361-d8f6-477d-9dbc-b58ce2e550ac","resolution":{"observed_at":"2026-08-07T14:20:38.939358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.492597Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":"1300b4c0-f17e-4801-b8a5-84d9418e5288","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:38.995078Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c0839e8823932ba5226d2c5497ee993f2d436c977ddcbba89c7bcc9990054e63","observation_id":"1a19bf54-4dc7-4172-b70c-84e0a8517511","resolution":{"observed_at":"2026-08-07T14:20:45.570026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00311","last_updated":"2023-09-30T08:50:49Z","snapshot_observed_at":"2026-08-15T14:00:27.377895Z","submitted_at":"2023-09-30T08:50:49Z","title":"Efficient Planning with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00311","snapshot_observed_at":"2026-08-07T14:20:39.045014Z","title":"Efficient planning with latent diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.045014Z"},"links":{"cited_paper":"/paper/2310.00311","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:58bdf07a975e99d004d37af05408a991a840bb3f975f7d88640c235eef2fc4a0","observation_id":"65e40278-984b-4041-8211-9b2dc7e9e0a3","resolution":{"observed_at":"2026-08-07T14:20:39.045014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.337045Z","title":"Hierarchical diffusion for offline decision making","venue":null,"work_id":"9a1fca48-665b-4600-b6d5-9252e4e7394b","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.111910Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:1cf4bf8df44e54943bc12474fb19edea1c8c8df2eae6853109941b5fadc7b3c3","observation_id":"38d867f4-4693-4e1b-81ca-6b0a6d249a75","resolution":{"observed_at":"2026-08-07T14:20:45.411100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:39.162569Z","title":"Generative models in decision making: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.162569Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:4a130a9d947d0b6090faa304e5e48e8ad5c1f595293d8134814cdfc0277ea23d","observation_id":"cfe9aa23-86c1-407b-90fc-015a29e29dcd","resolution":{"observed_at":"2026-08-07T14:20:39.162569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.199186Z","title":"Flowvid: Taming imperfect optical flows for consistent video-to-video synthesis","venue":null,"work_id":"b2c0df8e-7af0-48a2-8d83-aec388eb7422","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.252580Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:fb78ae75ef2eb574060ee802e95ff775ae847069873087c5b9e2bdb686526aa0","observation_id":"32e09caf-2a45-4896-9ecb-97a749b894da","resolution":{"observed_at":"2026-08-07T14:20:45.229974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01877","last_updated":"2023-05-12T16:23:37Z","snapshot_observed_at":"2026-08-13T12:51:54.785610Z","submitted_at":"2023-02-03T17:28:59Z","title":"AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01877","snapshot_observed_at":"2026-08-07T14:20:39.290915Z","title":"Adaptdif- fuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.290915Z"},"links":{"cited_paper":"/paper/2302.01877","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:b3736393c15b09b64bc15a71d24661bae88f078235677f65840a408f73997a9b","observation_id":"f3f5e4cf-2988-4a3b-8c56-6046e29e676e","resolution":{"observed_at":"2026-08-07T14:20:39.290915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.20299","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:43.011283Z","title":"Dataset distillation for offline reinforcement learning","venue":null,"work_id":"c9b054bc-d8b8-47d9-ba94-d201510f2f8c","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.370378Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:97734dc41dfe091d3a1864fce5dea2e21c5adb2326d225faf69d78ce1939acbf","observation_id":"59e99e51-59f7-4256-8a97-fd6895b8c622","resolution":{"observed_at":"2026-08-07T14:20:43.045019Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T14:20:39.454108Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.454108Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:2c809e792f11a29ebf40fd433020f2af9b1613961c5be448d5c6a5122453f2d9","observation_id":"ab098d77-bed5-4008-b1fa-e314f1024513","resolution":{"observed_at":"2026-08-07T14:20:39.454108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-14T10:51:24.885214Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-07T14:20:39.518713Z","title":"Flow matching guide and code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.518713Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f7b22848a4ad41622ffa8483187aa550bc6b2947876318251a5db34331811c9d","observation_id":"b8d5be13-e190-4420-89b9-8fb618ada7a5","resolution":{"observed_at":"2026-08-07T14:20:39.518713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-08-13T05:41:00.933463Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-08-07T14:20:39.553836Z","title":"Generative pre-training for speech with flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.553836Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:de4b54d9f6e63adc54e1fb7d45a84617a4dc27f9796f0ae4809318998a9123e5","observation_id":"9233db61-bb90-43e3-804e-88b4e89d4d0b","resolution":{"observed_at":"2026-08-07T14:20:39.553836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02165","last_updated":"2024-08-04T23:23:48Z","snapshot_observed_at":"2026-08-12T23:08:47.118146Z","submitted_at":"2024-08-04T23:23:48Z","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2408.02165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02165","snapshot_observed_at":"2026-08-07T14:20:42.814210Z","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","venue":"cs.LG","work_id":"7f2d1565-2bcc-464d-b3a4-f39711d7042a","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.589213Z"},"links":{"cited_paper":"/paper/2408.02165","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:2584f68f7a93ea253bdcc0ee029801a359dab97cdac007d29f57de8c081eb778","observation_id":"4f762be6-8ef3-4a64-8971-1ee7b7732092","resolution":{"observed_at":"2026-08-07T14:20:42.862741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-08-12T22:33:14.632545Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-07T14:20:39.668066Z","title":"Uncertainty- aware reward model: Teaching reward models to know what is unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.668066Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:738786d37dd5d42af0659b991d13a051c41cf3c9cb50e3121f539a63c8066fa9","observation_id":"bfb96da5-a6e1-454f-9a76-5ed920a99fc4","resolution":{"observed_at":"2026-08-07T14:20:39.668066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:39.718510Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.718510Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ab9e753f4238ec138698e86faa0999f304ed850ab60359d6356adffdbcecfb16","observation_id":"5d8b44d6-4635-4d16-b8a7-05a935b8b799","resolution":{"observed_at":"2026-08-07T14:20:39.718510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20109","last_updated":"2024-10-31T06:16:24Z","snapshot_observed_at":"2026-08-15T05:57:28.049034Z","submitted_at":"2024-07-29T15:36:42Z","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20109","snapshot_observed_at":"2026-08-07T14:20:39.813467Z","title":"Diffusion-dice: In- sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.813467Z"},"links":{"cited_paper":"/paper/2407.20109","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a5d528751f8593f988e726f23a8d8fa8bc0474ca36e76c45c09e2d9e09c9c0b7","observation_id":"8ad00c81-8a7f-4c6f-aa43-aa704d9760cd","resolution":{"observed_at":"2026-08-07T14:20:39.813467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T14:20:39.855798Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.855798Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8dbd724be4c0198cd3b40c0874206c61792360bb29ef5f8d62a3ec01cdddc96c","observation_id":"38f3ad79-c04a-4fb3-9f11-329072bf7a95","resolution":{"observed_at":"2026-08-07T14:20:39.855798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:39.960749Z","title":"Normalizing flows for probabilistic modeling and inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:39.960749Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:fe3b1f3c3c16fbd9549a8fa9c84b199cdf0e133e0c5bf661b3099e33bba8fb02","observation_id":"85234d8d-2dcc-48bf-9bb7-ecccdb2ee88d","resolution":{"observed_at":"2026-08-07T14:20:39.960749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-12T18:03:00.749482Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-08-07T14:20:40.029877Z","title":"Flow q-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.029877Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:6ee9b94226591d194cd04166182107c950a118d9d0fa0f3417f268ce60466b5f","observation_id":"c9adb103-e45c-4af9-8025-061ce3b280dd","resolution":{"observed_at":"2026-08-07T14:20:40.029877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T14:20:40.119405Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.119405Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:08b953f2f4f028bea872c21a3bffde5d2e6f7d81ba79fec00b7a1c8e488ff9f5","observation_id":"7573d0f4-41ed-4f64-90d9-6fbf94a9db52","resolution":{"observed_at":"2026-08-07T14:20:40.119405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-14T20:28:40.368392Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-07T14:20:40.163607Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.163607Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:c52893342d2f39c6c839a442fd643acbf70fce77ebbb25770404d8cd68b3752c","observation_id":"b6a752ef-5d03-40be-9253-bb2ee4a3ab12","resolution":{"observed_at":"2026-08-07T14:20:40.163607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15205","last_updated":"2024-12-19T18:59:31Z","snapshot_observed_at":"2026-08-15T04:12:43.355638Z","submitted_at":"2024-12-19T18:59:31Z","title":"FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15205","snapshot_observed_at":"2026-08-07T14:20:40.249756Z","title":"Flowar: Scale-wise autoregressive image generation meets flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.249756Z"},"links":{"cited_paper":"/paper/2412.15205","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:46fdd547d77815a1287031eb24393beda71bbc264c1779d8e9df0b5455d59109","observation_id":"294b33b5-01f2-46d9-8400-56e849367032","resolution":{"observed_at":"2026-08-07T14:20:40.249756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:45.067545Z","title":"Offline reinforcement learning as anti-exploration","venue":null,"work_id":"67a32b81-9533-4a29-a290-8ef84bde1861","year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.346131Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:755338178a9a3b006ae104631ee56fd4064805712e605827248ec80bad769410","observation_id":"e4601625-e387-4bc5-850e-c7d99470c718","resolution":{"observed_at":"2026-08-07T14:20:45.103384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.994496Z","title":"Flow matching imitation learning for multi-support manipulation","venue":null,"work_id":"2400975d-261b-4ec2-9e1a-4d1d307e8ac1","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.424534Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ea3206abbee7452265f5d2ff46cc8328d95fcdb0294db524db75ad4d324b35b8","observation_id":"1359d8ca-070a-490e-b627-436869ba5b16","resolution":{"observed_at":"2026-08-07T14:20:45.033689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06473","last_updated":"2020-02-15T23:46:29Z","snapshot_observed_at":"2026-08-12T00:44:31.377949Z","submitted_at":"2020-02-15T23:46:29Z","title":"Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2002.06473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.06473","snapshot_observed_at":"2026-08-07T14:20:42.594777Z","title":"Universal Value Density Estimation for Imitation Learning and Goal-Conditioned Reinforcement Learning","venue":"cs.LG","work_id":"6986ad8a-5b6c-48df-8bfc-bc0ffb74840b","year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.480698Z"},"links":{"cited_paper":"/paper/2002.06473","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7b515be22ec7f754a26edf63b2401c5e32d96e8251df073655e5e416446aabd1","observation_id":"3dd87819-0a97-400f-b2ca-18147394877c","resolution":{"observed_at":"2026-08-07T14:20:42.624081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.842817Z","title":"Video prediction by modeling videos as continu- ous multi-dimensional processes","venue":null,"work_id":"af1c3808-fed7-4b7f-9631-cfa9c327c1f8","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.557491Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a4ed4478d2be4da5d1e139479463184189700ff5c5a65dbca87a452efad02ee4","observation_id":"95c2ff49-a3ee-44e9-b473-67f0eae07cd3","resolution":{"observed_at":"2026-08-07T14:20:44.881671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.735519Z","title":"Ensemble reinforcement learning: A survey","venue":null,"work_id":"82dcbab9-7a63-429d-bb03-d4cc79eb6994","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.620346Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:a162e840e21f934fe300ea1ed129933294cdfa7a53e81b93c157fb58ff34f46d","observation_id":"a9556fd5-b4ff-43c3-ac7f-117dbc136841","resolution":{"observed_at":"2026-08-07T14:20:44.775098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.572687Z","title":"Flowllm: Flow matching for material generation with large language models as base distributions","venue":null,"work_id":"2723a894-a488-4b20-9ea2-5e8ca2f3ceea","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.692841Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:35a321d38c1a3960a2adb17639174723fe67a258edd286311b1b88336e5e9170","observation_id":"21c57fae-dcc9-4d7d-b384-60b51ad6ebd2","resolution":{"observed_at":"2026-08-07T14:20:44.668710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:40.739672Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.739672Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:dc3fd9cd43d88739ef6cecd666e63cbd16179da746c0fcdcfbe042b13725bb00","observation_id":"c137d2e6-7826-482f-a691-963b72e1096a","resolution":{"observed_at":"2026-08-07T14:20:40.739672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.465988Z","title":"Imitationflow: Learning deep stable stochastic dynamic systems by normalizing flows","venue":null,"work_id":"436cb629-93d8-41bf-a5ca-f99e04451ea5","year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.800133Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8d672db5b3cf3258f648ef45b984db54fbcaa6f8a802dc9dde41dd1a59265911","observation_id":"f4f26b48-b58e-421b-a12c-173f4c8ed829","resolution":{"observed_at":"2026-08-07T14:20:44.526585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:40.893058Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:40.893058Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:080473425d368146bf8f51d434eb7605bd668500bc4d706b06c29709d85a40d3","observation_id":"791942d1-952a-4327-8c45-833414bec49b","resolution":{"observed_at":"2026-08-07T14:20:40.893058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.326823Z","title":"Matrix calculus operations and taylor expansions","venue":null,"work_id":"0ad3909d-f6af-43d7-9cad-3ffaf36ff5dc","year":1973},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.012416Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:344aba2cb80db8b540e4f6d62edec4a67c7768346c2a8b10ce81f2998f211357","observation_id":"4141acbe-6d66-4c89-9103-23b54f1a66c8","resolution":{"observed_at":"2026-08-07T14:20:44.377627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08569","last_updated":"2022-10-18T05:05:22Z","snapshot_observed_at":"2026-08-14T13:19:07.394344Z","submitted_at":"2022-06-17T05:57:47Z","title":"Bootstrapped Transformer for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2206.08569","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08569","snapshot_observed_at":"2026-08-07T14:20:42.505319Z","title":"Bootstrapped Transformer for Offline Reinforcement Learning","venue":"cs.LG","work_id":"3af1ea6e-a9bc-4438-be9a-9b5823ef9d6a","year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.057275Z"},"links":{"cited_paper":"/paper/2206.08569","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d0669f6e3a019e477a7bed3da829cc4351e02aff209927c6132f1ac302686581","observation_id":"4abbb693-68da-4591-a9cf-10b94f6997cf","resolution":{"observed_at":"2026-08-07T14:20:42.534167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-08-14T19:53:20.733533Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-07T14:20:41.144029Z","title":"Prioritized generative replay","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.144029Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:8852d86157e771f9decafa9874a869f2a56903ba73d8c224c34e5264490e1dd1","observation_id":"e161bd7c-6c5e-48ef-a647-89c905ddf6f5","resolution":{"observed_at":"2026-08-07T14:20:41.144029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-08-12T13:12:28.417467Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T14:20:41.247019Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.247019Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:bb29806ea14164503dd95e70754c05d21c6a8f30d2411d43b53a43220b1ab215","observation_id":"d52a9e49-a01c-4f4b-9059-477a16ecc566","resolution":{"observed_at":"2026-08-07T14:20:41.247019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.261958Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"f8946b2b-3287-4633-97f6-3750b08b7e96","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.312573Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:7e3862deae496d734493a570d8910bb902d1ace2c7fc554bd4e88115e9d20bcb","observation_id":"b99e1af5-4281-4452-af04-637c5620b629","resolution":{"observed_at":"2026-08-07T14:20:44.291215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09673","last_updated":"2022-10-07T23:57:50Z","snapshot_observed_at":"2026-08-06T06:26:43.117768Z","submitted_at":"2022-02-19T20:22:04Z","title":"A Behavior Regularized Implicit Policy for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09673","snapshot_observed_at":"2026-08-07T14:20:41.361128Z","title":"A behavior regularized implicit policy for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.361128Z"},"links":{"cited_paper":"/paper/2202.09673","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:ec4062effb0d0462d67f51f1920d717f1315ed0f46c892f390e409cf81a37798","observation_id":"432d8a0e-306f-423c-b0bf-dd14ab8a6b5e","resolution":{"observed_at":"2026-08-07T14:20:41.361128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.429401Z","title":"Policy-to-language: Train llms to explain decisions with flow-matching generated rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.429401Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:1375e60276bf45693097ab1175a0f8ae55d107ddc884096e74b83755e96a2cf7","observation_id":"9bc740fc-e567-476a-b66e-cd6ed73ada50","resolution":{"observed_at":"2026-08-07T14:20:41.429401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:44.105195Z","title":"Flow to control: Offline reinforcement learning with lossless primitive discovery","venue":null,"work_id":"33eb07ad-11e7-4c61-a3a6-65a1e8eab7c0","year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.499645Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:b71f144bb02ccd8c4ede21efdc5a535a8257aa4abb157fe9a3602f86c8cf3891","observation_id":"fb0554b1-a476-4222-a6be-78aec2d74647","resolution":{"observed_at":"2026-08-07T14:20:44.222293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.575848Z","title":"Mopo: Model-based offline policy optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.575848Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:e510cef8ee724e804aab8fa94666b3f2e8ccfc19afe93250c9e4b99d07b461a9","observation_id":"f99fefd8-8556-41f7-a0d0-c7de39ef5974","resolution":{"observed_at":"2026-08-07T14:20:41.575848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.631335Z","title":"Combo: Conservative offline model-based policy optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.631335Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:45a09eb4814e803d68ec49320c1ec2ce80c21290a04952e07de3d7c936f2600a","observation_id":"1598d88e-dd30-43c9-beef-1edfb68bf0ce","resolution":{"observed_at":"2026-08-07T14:20:41.631335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:41.678599Z","title":"Affordance-based robot manipulation with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.678599Z"},"links":{"citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:69cfed1b2b390671d699b747952eb974378a0c05c2286445913fbf539cb55f37","observation_id":"57bd9d08-6527-423c-9fec-719af8a1f20a","resolution":{"observed_at":"2026-08-07T14:20:41.678599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12203","last_updated":"2023-01-28T13:57:01Z","snapshot_observed_at":"2026-08-14T09:56:44.991611Z","submitted_at":"2023-01-28T13:57:01Z","title":"SaFormer: A Conditional Sequence Modeling Approach to Offline Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12203","snapshot_observed_at":"2026-08-07T14:20:41.739960Z","title":"Saformer: A conditional sequence modeling approach to offline safe reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.739960Z"},"links":{"cited_paper":"/paper/2301.12203","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:0bf53a7a4bb456b0174803aaede932f1ec0debef4701b5154516aba3385cb6fb","observation_id":"0840203d-2792-4814-b7b9-6059b49ff997","resolution":{"observed_at":"2026-08-07T14:20:41.739960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04975","last_updated":"2025-03-06T21:10:12Z","snapshot_observed_at":"2026-08-14T23:35:11.392653Z","submitted_at":"2025-03-06T21:10:12Z","title":"Energy-Weighted Flow Matching for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04975","snapshot_observed_at":"2026-08-07T14:20:41.812673Z","title":"Energy-weighted flow matching for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.812673Z"},"links":{"cited_paper":"/paper/2503.04975","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:f3a8011921e5a56072428d5d5f36adc0d735d8a2ba9a9e95c0e710d88aabb6b6","observation_id":"863b8cb8-2f9d-4b82-9b87-409e89188567","resolution":{"observed_at":"2026-08-07T14:20:41.812673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18729","last_updated":"2024-05-29T03:19:59Z","snapshot_observed_at":"2026-08-12T23:55:33.902066Z","submitted_at":"2024-05-29T03:19:59Z","title":"Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2405.18729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18729","snapshot_observed_at":"2026-08-07T14:20:42.161826Z","title":"Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning","venue":"cs.LG","work_id":"e97abfb4-32ac-4b92-b836-dd1f6f6cbd8c","year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.895384Z"},"links":{"cited_paper":"/paper/2405.18729","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:aea810c7832898109cfd3a380decf0dcbc0e13ea2b208c5bc9a983c0b62697fa","observation_id":"1319d61f-646e-43b1-acc6-e301f0bad3a3","resolution":{"observed_at":"2026-08-07T14:20:42.215919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-08-13T05:19:37.188974Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-07T14:20:41.964655Z","title":"Guided flows for generative modeling and decision making","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.964655Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:d725e1c1d0451d0a3d30bd9522abda08b092ec47a498c29b139d9a56256a26e1","observation_id":"edd50545-d00f-4770-bc6e-9e6cce26abe9","resolution":{"observed_at":"2026-08-07T14:20:41.964655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T14:20:42.023257Z","title":"uθ(xt, t) ∗ Z pt(x1|xt) ut(xt|x1) pt(xt|x1)p(x1) pt(xt) dx1 # pt(xt)dxtdt (30) = Z t,pt(xt)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:42.023257Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:df0790737871fb2a8ee757bc07391056a78059f4d307a89f7486b5f7fa0098d0","observation_id":"f4db1893-30e5-461d-acef-c364e040e909","resolution":{"observed_at":"2026-08-07T14:20:42.023257Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T00:42:47.737693Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":7,"verified_fuzzy":17},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2505.20350."}