{"as_of":"2026-08-09T23:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81812184e18302f1b6393be6fbff74381f36ab4640a057b5a11833f0a4ecefd5","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:56:30.265947Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:42:22.223628Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.122193Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-05T14:42:22.223628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21016","last_updated":"2025-08-28T17:18:31Z","snapshot_observed_at":"2026-08-06T03:08:28.577840Z","submitted_at":"2025-08-28T17:18:31Z","title":"Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:22.223628Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2508.21016"},"observation_digest":"sha256:a04f00bf7a355fe71f3e1e8373b38b3007351afae11d3e9f61ac1b0b88b52de2","observation_id":"56e107ec-6e8c-4c85-a1b2-0b52646da785","resolution":{"observed_at":"2026-08-05T14:42:22.223628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T16:54:30.953199Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2509.16117"},"observation_digest":"sha256:6c1aaf310c9ef5e4fec71b3f4594e25d47191a11f0be77554cfa8e2f0d46bcc8","observation_id":"e09793a3-be45-46dd-ab6f-0509b118ac7c","resolution":{"observed_at":"2026-05-13T16:54:30.998401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:a56b7ad586ba37ed1d20dfa103c3148c13fcc5a3625a9113954469ca14388057","observation_id":"c674f213-37de-4d0d-bacb-bec5bad07779","resolution":{"observed_at":"2026-05-12T10:34:59.250729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T21:06:29.374560Z","title":"Diffusion guidance is a controllable policy improvement operator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-09T04:09:44.376695Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.374560Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:9ab124ef5ccbe07d760794de9810b39a41c7f08e3c92b3b820c612940741e780","observation_id":"21705f32-f9ce-49ff-a85b-0490e878683c","resolution":{"observed_at":"2026-08-03T21:06:29.374560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T13:18:29.364170Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-08T13:07:41.021799Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.364170Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:08f66e1ba1fccb0ae53d8b2d89e6d0a4334c243e4d3fe8ce85194fe8fabc966b","observation_id":"cba2875a-4da8-40c8-be8f-2d6167778d44","resolution":{"observed_at":"2026-08-03T13:18:29.364170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:89e6c08f2937d92757cad33cf03bd9285b49ef1ce16801db0b7cbe160fd57065","observation_id":"1b108cbb-24e0-4cb4-a360-d36d9a30a11f","resolution":{"observed_at":"2026-05-16T02:30:31.938553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-02T23:47:54.752480Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint, arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12691","last_updated":"2026-06-20T06:22:27Z","snapshot_observed_at":"2026-08-06T14:37:27.953191Z","submitted_at":"2026-02-13T07:46:37Z","title":"ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:47:54.752480Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2602.12691"},"observation_digest":"sha256:c357caa9b4d4c92e9b8ad3dffb843daaf3acfc19acbaf228442dd44c58f4dcc1","observation_id":"c50286fe-3ad8-49ce-8090-0f3f49962bf5","resolution":{"observed_at":"2026-08-02T23:47:54.752480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:85028a71f9452f20407c8abc3cb5d8769b0caf0448225b673c7589c9cce73e89","observation_id":"6feff226-b30e-4dc5-ad74-e425c919bf0f","resolution":{"observed_at":"2026-05-15T22:06:43.044814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:47:45.866615Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10250","last_updated":"2026-05-24T03:43:13Z","snapshot_observed_at":"2026-08-06T17:26:04.405292Z","submitted_at":"2026-03-10T22:01:13Z","title":"GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T23:47:45.866615Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10250"},"observation_digest":"sha256:2285ad9270f9f085f61a320c106f342fd466ef179e051cb7d74cb9e5ae1b2ae9","observation_id":"9dae9f6f-7c72-481c-868b-5f8291ec48e8","resolution":{"observed_at":"2026-07-14T23:47:45.866615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Diffusion guidance is a controllable policy improvement operator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-07T08:16:48.418429Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:31fc33873443c44f87525637976e93319c6d56442df152fb9a5ae97441138b2b","observation_id":"54c53f7d-15fd-40a5-b96b-befcb10abac6","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Diffusion guidance is a controllable policy improvement operator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-07T09:35:56.440371Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:f806fbd4bcba82a3adb35aaf226d72e3f269e5fa611bb78e76d57a73c64646b1","observation_id":"99916ee1-1754-44d0-ac18-3fa2ad6c56d5","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:08.970164Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.08168"},"observation_digest":"sha256:e55d07f1a7f289bae0ec17e92179580a394ed766f025db368cf77ce427cab586","observation_id":"cc3c10a8-86bf-4b35-95a9-20bf1f2df124","resolution":{"observed_at":"2026-05-11T07:25:59.160153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-13T00:03:53.609175Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08169","last_updated":"2026-07-02T01:38:10Z","snapshot_observed_at":"2026-08-07T08:51:57.871195Z","submitted_at":"2026-04-09T12:28:22Z","title":"Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T00:03:53.609175Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.08169"},"observation_digest":"sha256:19b4e11117b46a8b99df9d635dc640a1a830bd3009bf0f5ce48c07b775b6c36b","observation_id":"b7a92b01-d2b5-4d81-a199-b009fea7e531","resolution":{"observed_at":"2026-07-13T00:03:53.609175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.08174","last_updated":"2026-04-09T12:31:43Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:31:43Z","title":"Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:51.653571Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.08174"},"observation_digest":"sha256:384a4c92c593059dfa794e6eb0e64c64e4c6801891445abbb5017e62c708074f","observation_id":"116dcf5c-f634-4dfc-a916-2a6d8186b23f","resolution":{"observed_at":"2026-05-11T08:05:58.896724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:9a9165b00aa9b9a488c5850f79bc9907062a01b9fb1998ecb2b25a8d5e7690ab","observation_id":"751150a7-56e0-4b66-bdbd-90071755782a","resolution":{"observed_at":"2026-05-10T13:20:25.655050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2604.15577","last_updated":"2026-04-16T23:13:22Z","snapshot_observed_at":"2026-08-03T19:50:27.280341Z","submitted_at":"2026-04-16T23:13:22Z","title":"Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T10:54:57.732141Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2604.15577"},"observation_digest":"sha256:2f9fbbe596f2a9dddc7d9302b871a5bff0a87320268aa125bd9f95a3147cfce8","observation_id":"0b4e3dca-8494-4ee4-a417-c80a3138ea27","resolution":{"observed_at":"2026-05-10T10:55:03.845502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.03075","last_updated":"2026-05-04T18:44:19Z","snapshot_observed_at":"2026-07-06T23:16:05.372336Z","submitted_at":"2026-05-04T18:44:19Z","title":"Refining Compositional Diffusion for Reliable Long-Horizon Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T17:47:58.141126Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.03075"},"observation_digest":"sha256:5e80a2d6afdc3f78a4b1dc07342aae0dc4e29e3738784327fe40dc165eea23d9","observation_id":"d03a8337-83c4-4fc6-99fc-a10f2e1ca7cb","resolution":{"observed_at":"2026-05-11T17:11:18.920112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.13013","last_updated":"2026-05-13T05:07:32Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T05:07:32Z","title":"JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T19:37:19.404335Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.13013"},"observation_digest":"sha256:1fec5aa3213ab1125f649857f84e37ec966f608e92df3d96bf3130f8443a3dd5","observation_id":"160a7291-e759-4891-abc5-4bf75cc0c274","resolution":{"observed_at":"2026-05-14T19:37:51.906678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:26:19.032362Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:802a65cb5938ba15789d7931cf8a350efbb415557d259f796c2fa1056ecfeea2","observation_id":"a00fd679-7e6d-4d2a-ac68-b370845d1fa2","resolution":{"observed_at":"2026-05-14T19:27:51.690341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:35:14.348849Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:83611ce8c5800f943f0516966653266d569b8270633a8304bc0749e82d71ba0e","observation_id":"5dd19e58-12e4-4496-a756-b80bf09c29d3","resolution":{"observed_at":"2026-07-01T14:25:46.674696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.09009","last_updated":"2026-06-08T04:13:38Z","snapshot_observed_at":"2026-08-05T08:14:57.435064Z","submitted_at":"2026-06-08T04:13:38Z","title":"Scaling by Diversified Experience for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T17:12:50.216492Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.09009"},"observation_digest":"sha256:1feddb4acabea7e21b855d465f4c0a249b405e7fdb71ac0a634cbb636073b8a2","observation_id":"2f04b9ec-b5c1-47d0-bfe7-c1b9dbe2fb5f","resolution":{"observed_at":"2026-07-03T00:27:29.703257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.09615","last_updated":"2026-06-08T15:21:45Z","snapshot_observed_at":"2026-08-03T16:03:00.502890Z","submitted_at":"2026-06-08T15:21:45Z","title":"DexPIE: Stable Dexterous Policy Improvement from Real-World Experience","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:22.504175Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.09615"},"observation_digest":"sha256:f88b1195ef3824f6a438088f29befcd865865197218ae67468a6a51563a6c89e","observation_id":"52822f58-c9ec-4ed4-8971-7b239830740f","resolution":{"observed_at":"2026-07-03T01:07:30.658025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:610404c7551c649377b72051dfe65793e558736cd774e05a5fb2edc6308e86b4","observation_id":"bf1732f0-4678-40d3-8402-69278e232546","resolution":{"observed_at":"2026-07-03T04:17:36.902987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.13675","last_updated":"2026-06-11T17:59:45Z","snapshot_observed_at":"2026-07-30T00:58:38.369141Z","submitted_at":"2026-06-11T17:59:45Z","title":"Improving Robotic Generalist Policies via Flow Reversal Steering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:20:19.209180Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.13675"},"observation_digest":"sha256:3dcb7c9ce827e855f1adb6df5065abe789ba4e70c4afb209ff7b8aca1627dc79","observation_id":"9b5bc7f2-3940-4368-a58f-6b6c11111dbd","resolution":{"observed_at":"2026-07-03T15:48:35.715045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.17551","last_updated":"2026-06-16T05:56:10Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:56:10Z","title":"Reversal Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T02:30:24.951689Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.17551"},"observation_digest":"sha256:0307bfb5d097338a80047125097c5959d3c00e81137c1e513afef23a16949bd1","observation_id":"ee17dbea-1e62-424d-b08f-aa196c8abe32","resolution":{"observed_at":"2026-07-03T18:38:49.860828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.21406","last_updated":"2026-06-19T13:17:27Z","snapshot_observed_at":"2026-08-03T16:52:45.806990Z","submitted_at":"2026-06-19T13:17:27Z","title":"Robot Self-Improvement via Human-Video Dynamics Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T14:40:13.855741Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.21406"},"observation_digest":"sha256:311ca654a60ae8f315bbd2464079be544f4036b6807f060d817c688952b5e7e0","observation_id":"423458cd-c8b6-4838-9d59-e3ce23867c09","resolution":{"observed_at":"2026-07-04T06:19:37.562830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.24231","last_updated":"2026-06-23T07:21:36Z","snapshot_observed_at":"2026-08-09T11:12:47.219255Z","submitted_at":"2026-06-23T07:21:36Z","title":"FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:49.473294Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.24231"},"observation_digest":"sha256:40e669d0b8389751285cb81eb8f2a904cb26b71bcecaa305209530ddc4c06b6b","observation_id":"4df7f6ef-7196-4271-bc01-16b0a71e1671","resolution":{"observed_at":"2026-07-04T16:39:58.123745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.28939","last_updated":"2026-06-27T14:23:21Z","snapshot_observed_at":"2026-08-08T10:16:12.744003Z","submitted_at":"2026-06-27T14:23:21Z","title":"ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T09:45:55.963036Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.28939"},"observation_digest":"sha256:a847b1ad651f50859c3531369baefee45c35bd8a40576fbc0497d0532844805f","observation_id":"ac60c372-34e8-4bca-9091-38a5ec11690e","resolution":{"observed_at":"2026-06-30T12:54:40.533700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2606.29834","last_updated":"2026-06-29T06:19:35Z","snapshot_observed_at":"2026-08-05T12:21:57.329914Z","submitted_at":"2026-06-29T06:19:35Z","title":"STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:17:48.731091Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2606.29834"},"observation_digest":"sha256:5fdbe2dc7856233d5839ec7948d997da9a1713c52d44e2cda86f05c24ede0e83","observation_id":"da2aa04d-e3cb-46c6-a4ee-83dbef6125dd","resolution":{"observed_at":"2026-06-30T06:24:19.474411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":"2505.23458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-04T16:39:58.122193Z","title":"Diffusion guidance is a controllable policy im- provement operator.arXiv preprint arXiv:2505.23458","venue":null,"work_id":"85c1b3dc-42d2-4b34-9b85-9da92334b592","year":2025},"citing_paper":{"arxiv_id":"2607.02496","last_updated":"2026-07-02T17:55:39Z","snapshot_observed_at":"2026-08-05T17:58:26.059813Z","submitted_at":"2026-07-02T17:55:39Z","title":"Controllable Sim Agents with Behavior Latents","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-03T10:41:09.285743Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.02496"},"observation_digest":"sha256:a9b2863d0876ecb95105d1e7194ebb0c8da2cf9c7ce9f8a8270618426a2653c7","observation_id":"f9f5b974-9bec-4850-9588-93545f270202","resolution":{"observed_at":"2026-07-03T10:48:01.976930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-12T06:41:57.276146Z","title":"Frans, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02840","last_updated":"2026-07-03T00:23:30Z","snapshot_observed_at":"2026-08-05T03:55:15.314478Z","submitted_at":"2026-07-03T00:23:30Z","title":"TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:41:57.276146Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.02840"},"observation_digest":"sha256:dec6df44274225de88e96fd37e1e21521885fe2d73dbfd7d6a96829a796fb77b","observation_id":"ac80c2fb-d7eb-4c50-935b-3f66ea3d10e2","resolution":{"observed_at":"2026-07-12T06:41:57.276146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Frans, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-06T15:16:44.357534Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3662d6b6c1e43e49f20df4b68b7ef440f68b7ef15de53162798f1efcebe2ae07","observation_id":"e2819e81-cf32-47a0-9c56-7434a032f4f6","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-01T01:32:27.374609Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27782","last_updated":"2026-07-30T07:14:39Z","snapshot_observed_at":"2026-08-07T16:30:55.760479Z","submitted_at":"2026-07-30T07:14:39Z","title":"RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T01:32:27.374609Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.27782"},"observation_digest":"sha256:629a96a5c1e9732f628ff03e3f6af7db3c43e9200b52721222c570c82ee3e6b9","observation_id":"f08ee7e7-79ca-4e0b-ac81-af9759d37e18","resolution":{"observed_at":"2026-08-01T01:32:27.374609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T12:23:58.895544Z","title":"frame_index","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29172","last_updated":"2026-07-31T08:50:25Z","snapshot_observed_at":"2026-08-08T10:40:09.041344Z","submitted_at":"2026-07-31T08:50:25Z","title":"CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T12:23:58.895544Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.29172"},"observation_digest":"sha256:b5551eecede6fc6df9a27e94567f05f9b437ed40666ed2b82ff82842ae9be34f","observation_id":"9f3b3865-8852-4d00-93fa-510cccdb0c58","resolution":{"observed_at":"2026-08-03T12:23:58.895544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23458/citation-record","integrity":"/paper/2505.23458/integrity","json":"/paper/2505.23458/citation-record.json","paper":"/paper/2505.23458"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.225725Z","title":"Diffusion policies for out-of-distribution generalization in offline reinforcement learning.IEEE Robotics and Automation Letters (RA-L), 9:3116–3123, 2024","venue":null,"work_id":"7e04ba8d-4686-49b1-94f2-492890222b70","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:24.913040Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:b035aa2dfe0c143218a1fc424880ff03bf7acc045728d50c516a0f69de6e7b2d","observation_id":"274acc93-49ec-4872-82e3-7fc79ccf1802","resolution":{"observed_at":"2026-08-07T12:56:32.230721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.210945Z","title":"Building normalizing flows with stochastic interpolants","venue":null,"work_id":"669099e6-c6d8-4b53-ab9b-63895cf03d13","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:24.978487Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:8e893b3b085d07333bb59857d0ba707526613fc5b704c06cca09f960162e0e53","observation_id":"0e25982c-fdbb-4d15-a09c-5f11796d28ca","resolution":{"observed_at":"2026-08-07T12:56:32.216123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.196668Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"9e18924c-0438-4873-a260-1fa1750ddf59","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.066955Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:27b22902bc2abc1d091e1886cc9cf4c161d4d182e76960f8d8c94172fd8a79b5","observation_id":"8c8a5edd-a8ff-4ab6-bfc9-6f2bd24dac69","resolution":{"observed_at":"2026-08-07T12:56:32.201252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.181560Z","title":"Hindsight experience replay","venue":null,"work_id":"4c31d418-b2e9-452b-85b4-5aa235bf1c42","year":2017},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.131856Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:1eb391cc1ba69bab966e28bd760d5b7e3d586af8f76dc85c00bf770a7a3242ee","observation_id":"d631dc44-c4c3-4791-a139-0e2f163d7972","resolution":{"observed_at":"2026-08-07T12:56:32.186004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:56:25.208106Z","title":"π0: A vision-language-action flow model for general robot control.ArXiv, abs/2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.208106Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:0587f2ece7cdd855572a44e4a6cf0438809c0a84d70eec6365f7d0ef0fab4fad","observation_id":"9d261bb7-52e2-42b6-9e15-7cd904e73583","resolution":{"observed_at":"2026-08-07T12:56:25.208106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:25.296803Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.296803Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:d83e0f91d435c4e5f89618604ee8b9ff221781b0d9e99677fecd606677628a10","observation_id":"58bcf97e-f0ce-4eb1-80b2-b42e8b204c9b","resolution":{"observed_at":"2026-08-07T12:56:25.296803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.156613Z","title":"Whitney, Rajesh Ranganath, and Joan Bruna","venue":null,"work_id":"ba13c2a9-d0fd-4d05-b76b-938d34cd80cd","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.405048Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:4b9179ced2f01ff23e26b2cc8802e22078be5639bcec817940358a6eb7f2f090","observation_id":"714c8e21-4f4a-42e1-88a9-710d62b6844c","resolution":{"observed_at":"2026-08-07T12:56:32.162096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.141047Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"de20a51f-06e6-4b13-a223-8aea98412419","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.509248Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:95eb6739d16589c091bd265f895117277d71058e9dd58197d09c0db1f2a43cd9","observation_id":"c8d9265a-1c4c-48e5-9356-e219f334da01","resolution":{"observed_at":"2026-08-07T12:56:32.145715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.126235Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":"e1a1dc40-82c6-46c4-97b9-227ec50eb54b","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.589564Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9d816fb2fa134f0d4b3432ff0e2716092002767fd65e930be769d10b2d9c1d19","observation_id":"74bde7e8-c041-4700-92e2-603a020bc4e2","resolution":{"observed_at":"2026-08-07T12:56:32.131431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.109586Z","title":"Aligning diffusion behaviors with q-functions for efficient continuous control","venue":null,"work_id":"de45a4ac-78f3-4f6d-9435-a44dd85b4073","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.704932Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:3134c440b62603fdc857743c6607fc1ac83bf632a25c92b600e2dd1279160c8c","observation_id":"802a466e-2092-4a69-b502-dbd8eef22ece","resolution":{"observed_at":"2026-08-07T12:56:32.115183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.095068Z","title":"Abbeel, A","venue":null,"work_id":"45184e5a-cfb9-4c20-a20d-6e37e9262c52","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.778783Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:0910a36897c54beb1c3c9779c70f85aa3298207391b017b250c9dbd916c2ed37","observation_id":"31dbe662-30bc-4e13-a288-4e83934ed286","resolution":{"observed_at":"2026-08-07T12:56:32.099654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.079988Z","title":"Diffusion policies creating a trust region for offline reinforcement learning","venue":null,"work_id":"8fe32c81-c8b1-4838-ada1-bfd048626195","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.891954Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:ab56255a5c4fa56d65212e456f9e92f774d95c94ac70cd50a0856099b117e6e7","observation_id":"2e5c6a4c-cd75-47ac-a79d-c4ac3e03c3fc","resolution":{"observed_at":"2026-08-07T12:56:32.084718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:25.998739Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:25.998739Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:1aab9a8a9d06b3d79db16c8e1007649c2c6dd8af490460b19df636ad80d2a797","observation_id":"f99072af-9eb1-449b-aa3c-70647f1bfc58","resolution":{"observed_at":"2026-08-07T12:56:25.998739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.054598Z","title":"da Silva","venue":null,"work_id":"6a5cd901-b668-4967-8ac4-88287a915f0e","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.110964Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:00eaa344ace8e1f99726eddc0d2b28924004e12f8811ec200cf251c68b93c78a","observation_id":"642ed821-922b-4b5d-a86d-7d811cc1397f","resolution":{"observed_at":"2026-08-07T12:56:32.059739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.038340Z","title":"Using expectation-maximization for reinforcement learning.Neural Computation, 9:271–278, 1997","venue":null,"work_id":"41893996-5256-4680-a45f-f4423f432e1c","year":1997},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.195008Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5a7b5ab236e7c67c744f2790f5a2092d8befbadd19d8e6599ebf5ce2f8de5574","observation_id":"6660750a-a6d4-4d59-a499-5734479665b2","resolution":{"observed_at":"2026-08-07T12:56:32.044191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.023356Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":"22a3706b-77ba-45fc-8b06-7dbe232fed3c","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.273415Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:c1b9b98c62b472cba9c5477649e8712a5376fc61e0def89f77a33def7d358ab6","observation_id":"6baffa69-bd7b-42ef-9032-355ef9e9716a","resolution":{"observed_at":"2026-08-07T12:56:32.028196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:32.006513Z","title":"Consistency models as a rich and efficient policy class for reinforcement learning","venue":null,"work_id":"88873d75-28c2-4cd5-874c-a53210da9f4c","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.379402Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:db3dc1242bbc83fd1aead316be50bc48d4be5e73d2ad1c009650cbab12e0466b","observation_id":"d2ae4034-f701-45e1-b67f-ce913f910fe1","resolution":{"observed_at":"2026-08-07T12:56:32.012294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.989104Z","title":"Rvs: What is essential for offline rl via supervised learning? InInternational Conference on Learning Representations (ICLR), 2022","venue":null,"work_id":"6e13b3e0-3e8c-42d9-b095-910a66b9e496","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.455926Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:07cd1f115f3c8af40d15b16f747359d79950c6b5930543fd01d4ea13771f888d","observation_id":"3dfa2dba-d65f-4a2f-b469-1a53c1577de1","resolution":{"observed_at":"2026-08-07T12:56:31.994233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.973033Z","title":"Imitating past successes can be very suboptimal","venue":null,"work_id":"1d19ce12-4d3e-41d4-a5b5-c7dfb56f3d16","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.558212Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:b2cb4952536f691466cdf5eef85735e07409899408a1c1d84ac6a4eabeec8055","observation_id":"c051a217-5a4e-4391-aacb-46e6b944f61f","resolution":{"observed_at":"2026-08-07T12:56:31.977730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.956163Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":"d6ea606b-b384-44a9-802a-6431279247f6","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.631969Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:42269dc632c3ca319028fb42a4b89d88a735d707a63c78a02117d8f23aed5dea","observation_id":"5256e09e-c9a8-4162-a405-424367c63127","resolution":{"observed_at":"2026-08-07T12:56:31.961567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.940603Z","title":"Diffusion actor-critic: Formulating constrained policy iteration as diffusion noise regression for offline reinforcement learning","venue":null,"work_id":"05f158f0-7edc-4dc3-a088-788f763dda09","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.695872Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:1da315002ba6f54c77d1f1c7f5b52d7cfca8c8336c50fa500c30fe94e23c811a","observation_id":"ab7d341c-fbe0-4bb5-bcbe-8476cdff4e70","resolution":{"observed_at":"2026-08-07T12:56:31.945632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.926010Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"2bc2e2dd-19fb-48a3-a29f-03755bed5cb0","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.785311Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6d43554d2f46f9cd72e9ed83b68babe2d68cc151fd64a81b6f72c9aba48a38e0","observation_id":"69bb8e44-52f8-4eaf-8a65-28adba2ab38f","resolution":{"observed_at":"2026-08-07T12:56:31.930897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:26.868584Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.868584Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:d01757daa0f066848c8d57ebef52e2e6074accd43bf1f9cd3ac8c1eaef16fdf0","observation_id":"8d237293-255e-4cc9-bb01-6abf487dfdd2","resolution":{"observed_at":"2026-08-07T12:56:26.868584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.901576Z","title":"Murphy, and Tim Salimans","venue":null,"work_id":"c72e4feb-5069-43ea-8c3b-2207c3883772","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:26.952030Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5e6ee1ce4e8d29c7dfbadc31bdd08c2b5c62e7c4d750074f4e5dd6aebac85cce","observation_id":"a683e37b-e065-4cb8-a17c-da924fc5e915","resolution":{"observed_at":"2026-08-07T12:56:31.906617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.886356Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"31463783-8dc7-485a-9969-0c95e01de61a","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.012832Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:f38437cb0c728a73082f1586659dfb06650170283d52d1775b48a75bdd6fa483","observation_id":"00d8e094-27f7-4188-ae32-abe1b12d04a9","resolution":{"observed_at":"2026-08-07T12:56:31.891327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.870269Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":"dd1e9324-d321-4473-a1d1-a68568ad329a","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.077763Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:e65efe0d2cd29dbe8789f0ec9fdf92226256bdb2ca1f0102726ee87455400fee","observation_id":"5a58fd3f-0340-408a-aa74-34bfd3a72932","resolution":{"observed_at":"2026-08-07T12:56:31.875520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.855084Z","title":"Closing the gap between td learning and supervised learning–a generalisation point of view","venue":null,"work_id":"08751c5a-0f80-4157-b5df-5e4dd7d46abf","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.159496Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:513697a03d1896ee4bead47cb2c2f81a8e5683f0ce8f53b1ea4c63b63ed5fec2","observation_id":"f936e271-bb74-451b-9a60-626cda99cec8","resolution":{"observed_at":"2026-08-07T12:56:31.860415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:27.219561Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.219561Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:bc2b815dd3e6fc1e16990bb2db16cf4732cc64f0070662a549ce438eca8fff8c","observation_id":"b890cd14-cc24-450f-8c7a-cb04512583e1","resolution":{"observed_at":"2026-08-07T12:56:27.219561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.829517Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"cc496cf6-09c7-457a-ab48-8c613ccef7b0","year":2019},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.306393Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:be192d4f3df28621f199e6f529b72f2109a597e039885a119cde80bb81abeecc","observation_id":"0af6ac9e-9dba-4833-81fe-212a580d3a1a","resolution":{"observed_at":"2026-08-07T12:56:31.835362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T12:56:27.377097Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.ArXiv, abs/2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.377097Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:031481100c7c02b6a05eba20143f2afdec36b028276bce035008120cc9c6496a","observation_id":"a609deab-73a5-4a8b-8378-70e300f433dc","resolution":{"observed_at":"2026-08-07T12:56:27.377097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05333","last_updated":"2024-02-28T13:48:09Z","snapshot_observed_at":"2026-07-06T16:29:32.059905Z","submitted_at":"2023-10-09T01:29:17Z","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05333","snapshot_observed_at":"2026-08-07T12:56:27.429381Z","title":"Diffcps: Diffusion model based constrained policy search for offline reinforcement learning.ArXiv, abs/2310.05333, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.429381Z"},"links":{"cited_paper":"/paper/2310.05333","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6f1ba47da2a770fcb996e6784ce430108a7bc85bb063889074931261dfbae541","observation_id":"d80827a7-1c30-4b8b-b0e5-1a18224f6796","resolution":{"observed_at":"2026-08-07T12:56:27.429381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:27.509049Z","title":"Aligniql: Policy alignment in implicit q-learning through constrained optimization.ArXiv, abs/2405.18187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.509049Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:654f33650ce2affc5a25b256a532909a8a24c401bfc230fcee39d414ce257130","observation_id":"5b45d15d-891e-4072-840a-4d8ea3a004fd","resolution":{"observed_at":"2026-08-07T12:56:27.509049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T12:56:27.600669Z","title":"Gaussian error linear units (gelus).ArXiv, abs/1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.600669Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:e5074ec4cf0771fe3f9c85a81a1eefeecbdec67bd77bab7f4ad38e4778336f07","observation_id":"4cdc18df-65ac-4108-9745-750ac70b7148","resolution":{"observed_at":"2026-08-07T12:56:27.600669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T12:56:27.693635Z","title":"Classifier-free diffusion guidance.ArXiv, abs/2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.693635Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5c5d69c0aa36480a1e4a94d081a40cf0e822b8adb852412dccfa04a1fdd54e08","observation_id":"53feb01d-6d0a-48da-8d91-cd9763944c6d","resolution":{"observed_at":"2026-08-07T12:56:27.693635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.814169Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"646aa0a1-7e9c-4edc-a23d-b740c064a11e","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.756726Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5dda1b5ddf7fa9439d212662567f29f080c1d121b3e54e51490ceaeccdedd29e","observation_id":"2b83f3ae-92e2-49cb-86b3-f8b5cf6b2d18","resolution":{"observed_at":"2026-08-07T12:56:31.818742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.799400Z","title":"Tenenbaum, and Sergey Levine","venue":null,"work_id":"361cbdfa-7e18-425a-b68b-bab7aad94920","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.830267Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:0c676261462ce50a6767fd3c68f0f3b5acfe6d4980b8d6ff6099ec0eb932a5c4","observation_id":"79375b08-a493-42d7-b055-4c6e4e25eb82","resolution":{"observed_at":"2026-08-07T12:56:31.803927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.785449Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"7563f9fc-0d3d-47fe-93fe-89c519806223","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:27.927436Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6ad9437c2081f966adf62bd2d3bc78c9bdd1aec5212b0345f241380e9c441e26","observation_id":"04dfc25a-5712-416c-ad4c-bb68502e31b6","resolution":{"observed_at":"2026-08-07T12:56:31.790011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.003819Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.003819Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:dc785e31289e66817719994ad993727f57f51a13523176346a670ad45fb2acfa","observation_id":"b0a23421-8d9a-4410-a78f-015dc9ea282a","resolution":{"observed_at":"2026-08-07T12:56:28.003819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.760661Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"59ece9e1-96f4-4ea3-af2f-06a096cf1ef4","year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.120329Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:376c9ead658632b82b5d101c0c927066560df1ab26100e06d1f7193b2027cc38","observation_id":"1f1d601c-2551-4ac9-8bc4-695c4a5526b3","resolution":{"observed_at":"2026-08-07T12:56:31.766144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.746174Z","title":"Advantage-conditioned diffusion: Offline rl via generalization.OpenReview, 2023","venue":null,"work_id":"528acd06-7615-4e23-9d8e-f042faded368","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.181310Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:1a962da36f89bac4636feb048407f2ecdc8789c6d1b28728d5a7dd0096d6f60c","observation_id":"19b2c0ff-aedb-4e00-8e0e-01f2ac6f42ab","resolution":{"observed_at":"2026-08-07T12:56:31.751229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-07T16:37:03.741931Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T12:56:28.274947Z","title":"Reward-conditioned policies.ArXiv, abs/1912.13465, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.274947Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:52080a6b6762b59dbe447b693b418127f618b6ae9a415bd3470c571a10e0ff50","observation_id":"b68cdd13-872c-4b13-9aac-37ecd00af636","resolution":{"observed_at":"2026-08-07T12:56:28.274947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.730853Z","title":"Tucker, and Sergey Levine","venue":null,"work_id":"205a970a-692c-4a1d-a64e-167348e8ee6e","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.365220Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:3fadc0caad96770b404436a3ab0e115cf548f535f851b13ae40db613b3c64c3c","observation_id":"8ab444d0-758f-4913-84b3-886758f587d9","resolution":{"observed_at":"2026-08-07T12:56:31.736331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.715080Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":"29e0f99b-d980-43af-ab61-12736b134ab7","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.446855Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a43ed98bcf5a28e5bc19a52b8a51c6eeea8b34eef05a6bf58fd2689de98489e9","observation_id":"54fb33ee-57a4-4ae5-ba20-ccd08657ac2d","resolution":{"observed_at":"2026-08-07T12:56:31.720162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.700780Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"7718db31-cd0e-4a75-aa7b-48d63a5018c4","year":2016},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.512443Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:ccd24d6fb818a2f52f39da1fa79397997b9711feee840bd0b1f72f15e2a76ef8","observation_id":"f14ddcfc-602d-4fa8-96ae-14e7d2bddbfb","resolution":{"observed_at":"2026-08-07T12:56:31.705213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.536332Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.536332Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:3f13254f5f0db6fbf2504907fe07915c739485583fba1304fdeb62b0970f66a9","observation_id":"c7778eff-81cd-448d-adc2-3761d12556a8","resolution":{"observed_at":"2026-08-07T12:56:28.536332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-07T12:56:28.549452Z","title":"Flow matching guide and code.arXiv preprint arXiv:2412.06264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.549452Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:577758426755d170a84007708541b4887ee08d450469d3434f96111c52ec5358","observation_id":"40be38c3-64eb-46d2-be15-b5110bc091d2","resolution":{"observed_at":"2026-08-07T12:56:28.549452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.554370Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.554370Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:d06aef880b7c5c18831c129f25339441f309188a07e19d4afe2f866c6aa9c628","observation_id":"c15fd0fc-e658-40a5-9f74-445ad8470372","resolution":{"observed_at":"2026-08-07T12:56:28.554370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.666923Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"179417b7-8989-4634-8119-b572ee3f8e2a","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.574898Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:47343fdf2d4014146050a0d25986afae3e36fef5b15bcf622cf8c25278cfd5dd","observation_id":"eb4ac65c-1a4a-45fd-89c7-228952e56585","resolution":{"observed_at":"2026-08-07T12:56:31.672148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:28.653436Z","title":"Learning latent plans from play","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.653436Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:7a720644dc065da6427373471f0c96eaf44bbf063cd5a4b99b47f1365cb506f8","observation_id":"186a8a5e-bffe-49d5-8301-714d5d616d02","resolution":{"observed_at":"2026-08-07T12:56:28.653436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.642982Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":"95de46bd-7c5e-4187-b202-88f6083003c9","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.713236Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:4988af296382ead7a9496cbcf6005b36528dcb31340566fe7739d0099d3a3142","observation_id":"8b39392f-0dca-4393-9244-8e326a2cd847","resolution":{"observed_at":"2026-08-07T12:56:31.647886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-07T12:56:28.792421Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.792421Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:533ad1fd62cd463c61c372b90676e7b724687613c9d8116d91c39b981a6224de","observation_id":"a7725c5d-50d7-4222-a48e-3c5cdce9f246","resolution":{"observed_at":"2026-08-07T12:56:28.792421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.628066Z","title":"Mish: A self regularized non-monotonic activation function","venue":null,"work_id":"e8a7a73b-46f5-4759-b950-3912c5cabd1c","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.875496Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5d238fe22a9650cfe0d402920ebf45dfe3646dac679f5ef68fe56e53131f79d8","observation_id":"ad88bfd8-f5c4-412d-b5d6-4f3426b19802","resolution":{"observed_at":"2026-08-07T12:56:31.633448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-07T12:56:28.945562Z","title":"Accelerating online reinforcement learning with offline datasets.ArXiv, abs/2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.945562Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6dc7641ee5363fb4b453ba9e25dd1cd6bddabb922593e9f90af7b0d00556dc31","observation_id":"dc9e6f52-cd4f-4fc8-b454-080ea9473496","resolution":{"observed_at":"2026-08-07T12:56:28.945562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.612999Z","title":"Anti-exploration by random network distillation","venue":null,"work_id":"4484772b-7ef5-49b8-a217-d54f40f167ab","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.026219Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:012e1d9ff61e837fac80f7dcecc7fea55feeca8e4a199e75531523c4d1ac169b","observation_id":"63304ea1-0b86-4062-ae8a-489c57bf65e0","resolution":{"observed_at":"2026-08-07T12:56:31.618102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.597513Z","title":"Is value learning really the main bottleneck in offline rl? InNeural Information Processing Systems (NeurIPS), 2024","venue":null,"work_id":"b3586e73-6fff-4867-aaee-ea0d09f08af3","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.036298Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:aa2795837fdd6cc277cc5a0b5e46fc9b454c38374dc3a24553a73f090c51cc6c","observation_id":"aff38423-441a-48b5-a61c-d9a8530723e8","resolution":{"observed_at":"2026-08-07T12:56:31.602591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:29.040779Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.040779Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:cce3f05b1050315524e8bb47b7355dd06e73de687acedfae533e2c2e70e10d04","observation_id":"e8f0d878-ac34-4dda-bbd3-57460468c85f","resolution":{"observed_at":"2026-08-07T12:56:29.040779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.573006Z","title":"Flow q-learning","venue":null,"work_id":"4392b131-286e-4c8c-8d5b-37c156dc4bcf","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.065263Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:da5054562c1743c9ab3d6e994e14ec69ff9da8e3d8ae2cdc390f71b3342f4752","observation_id":"47c62e4a-7ec3-413d-b363-d7a933bb5ccd","resolution":{"observed_at":"2026-08-07T12:56:31.577999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T12:56:29.148020Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.ArXiv, abs/1910.00177, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.148020Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:4e506897ab6e0e08e943a9e9db134a66d1da05a643baddd64a73a71fcdaee781","observation_id":"7c802dd2-e7f0-4e3a-a7c6-b8d2d3ce315d","resolution":{"observed_at":"2026-08-07T12:56:29.148020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.557225Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"8b2e7b6b-c8cf-420e-a4d2-05ac763ab641","year":2007},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.220323Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:e90d800cf7427f9104b29d3846d12b629cddeb596a17261a4208c2626892c5c6","observation_id":"2a6fe649-1620-49cb-9503-9196a9bba391","resolution":{"observed_at":"2026-08-07T12:56:31.562100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.543094Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":"d77cd4c0-9a8d-49f0-be80-bd48797f2c2b","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.278182Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5b799f49cc39ff23c609fa6418a6310699e88d90ea5e9d7dc68d269607c30c94","observation_id":"ea3880fc-0749-47e5-bbe3-6c9b3a1ad795","resolution":{"observed_at":"2026-08-07T12:56:31.547890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.530058Z","title":"Diffusion policy policy optimization","venue":null,"work_id":"294c6d9f-cdf4-4648-91fa-212aee244dac","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.356106Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:4cd893ddc85fdde9d1958af00294afd91595123c9e07d244858cf3c704fed63d","observation_id":"31f9eb45-0ce3-4031-be9e-a5a4fe774f09","resolution":{"observed_at":"2026-08-07T12:56:31.534055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.515781Z","title":"Trust region policy optimization","venue":null,"work_id":"3cd5cf80-aa31-4d51-a50e-80f4323ef7c9","year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.437576Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:b97d7909e0199b5322e4b9b2c1a4124d2d6edce7a94bbb95d362c3dd101b7801","observation_id":"ddb9c88b-0d86-4d36-9e6d-b96d693575d6","resolution":{"observed_at":"2026-08-07T12:56:31.520084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:56:29.495573Z","title":"Proximal policy optimization algorithms.ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.495573Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:64360e97f81cc9a8bb4741fd4bc69e1f738ddca013d3eb852b60deda463263fd","observation_id":"5794becc-5d9e-4908-a0c2-dc1fb1b1ee4d","resolution":{"observed_at":"2026-08-07T12:56:29.495573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.501954Z","title":"Sikchi, Qinqing Zheng, Amy Zhang, and Scott Niekum","venue":null,"work_id":"5d9ad2f8-2a8c-4d4b-a581-4d3949d08edd","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.534334Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:d9be410ab906967839c97e1236a3aa4e1c68ee16d009aaa2047b5253543aa6ab","observation_id":"f63e00e8-fe76-4f37-977e-baef64f090e5","resolution":{"observed_at":"2026-08-07T12:56:31.506492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:29.538385Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.538385Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:6eae6fd1021580d169619fdd742f0303deeba6363a89920664a54b80a04cbf88","observation_id":"d8c70b07-4674-4b80-ab56-1f72b7ca04a8","resolution":{"observed_at":"2026-08-07T12:56:29.538385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.479218Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"6c7c4a60-882d-4934-8dd7-cf03d93c1709","year":2019},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.544585Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:659717777cde8640c6a7ab312bd5509768f0890500ee29be98902386d1048543","observation_id":"ae689195-a547-4cfa-a0ef-fcc6fba41660","resolution":{"observed_at":"2026-08-07T12:56:31.483749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.464584Z","title":"Sutton and Andrew G","venue":null,"work_id":"3ea11ea1-1749-41e8-802a-7ec2c4cddac5","year":2005},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.612569Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:17bb840ad20d1aefb912023d3b27066ad47dcb65c1837caec48c45c375726e31","observation_id":"5871684f-043c-42a1-a6d1-2b1e394593d7","resolution":{"observed_at":"2026-08-07T12:56:31.469657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.409808Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"b2d3642d-55f1-4e76-bae5-1d559034c55e","year":1999},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.689334Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:41a55956c6f15389270faedd0e6dd8917110baeab0cf574830719fce5f041fd7","observation_id":"6b9578f0-d2a8-466d-8172-62933aaaca77","resolution":{"observed_at":"2026-08-07T12:56:31.442908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:29.760477Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.760477Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:824e7cc52ddb4e203780472b2f0a8c1277092dc36dae80c3b8572501a6e6a2d0","observation_id":"e82727e7-5032-43ee-9501-5bc00cdd03b7","resolution":{"observed_at":"2026-08-07T12:56:29.760477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.260124Z","title":"Learning one representation to optimize all rewards","venue":null,"work_id":"8ab37364-578b-441d-84b9-9dfbfaef2b38","year":2021},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.799586Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:79927bece6ddd748bacea99cd56795f35f0eec9b345498cfff021f673f6adeff","observation_id":"8204b323-f5b4-4fe3-a956-2fbf79d60459","resolution":{"observed_at":"2026-08-07T12:56:31.328623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.166660Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"f12a65d6-5792-44f1-b8fa-36d30a6af9fd","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.858233Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:61c8c4a592dfcc77b131366b6421fdd59f5fcf089c2be9fa00cea81dabaff33c","observation_id":"44ea1e02-a513-4732-a729-ed5ce1f0510c","resolution":{"observed_at":"2026-08-07T12:56:31.182390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:31.057368Z","title":"Reed, Bobak Shahriari, Noah Siegel, Josh Merel, Caglar Gulcehre, Nicolas Manfred Otto Heess, and Nando de Freitas","venue":null,"work_id":"3a46c901-ebf2-4b7a-9f0e-4a9df030ce67","year":2020},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.933259Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:347574c8169630533784dae9b520de29fa1e0448f280b06484c58981f3358ead","observation_id":"594f885e-0130-465b-a3d4-70f16a80e98d","resolution":{"observed_at":"2026-08-07T12:56:31.106882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T12:56:29.993903Z","title":"Tucker, and Ofir Nachum","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:29.993903Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:9e9ec59015873d88faaeaa2217d8130b08a4d8db6d814a7abb6298022778d8b5","observation_id":"e7adf455-ba68-41b8-ab50-8952b9fb234c","resolution":{"observed_at":"2026-08-07T12:56:29.993903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.946770Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":"e1655b32-08b2-4a6d-8fa2-46474c4c17d0","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.055766Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:e9de3126795c294d86200fa71fbe3dd178713b59b32b05fdba072fea18761b16","observation_id":"afcc1f24-a588-4efc-ba1a-105e0309a826","resolution":{"observed_at":"2026-08-07T12:56:30.997347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.816974Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"3f92eef4-a60b-481c-85b7-ce714c970680","year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.064184Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:8bb15a27255dca4dc4ae130e583bbb99a45f6d8d804960e7f7a4860e11c74d3b","observation_id":"481580db-6b44-4321-8133-98cbe73ed38e","resolution":{"observed_at":"2026-08-07T12:56:30.876244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-08T14:32:15.565933Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-07T12:56:30.069061Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.069061Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a7c2810820e16a25982a3f92d8c1ff4eb2af79bab64e1feb031f180f94b9b310","observation_id":"749c8f5a-2bf8-4433-b336-ba5affe8f977","resolution":{"observed_at":"2026-08-07T12:56:30.069061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-07T12:56:30.096727Z","title":"Abbeel, Alessandro Lazaric, and Lerrel Pinto","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.096727Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:5f7e73efd4107fceca7b6c08a2747810863f643792f5a73c18e7e582d94412f7","observation_id":"062be4fa-d7d1-4753-afa9-7000e4ee3e37","resolution":{"observed_at":"2026-08-07T12:56:30.096727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.683902Z","title":"Entropy-regularized diffusion policy with q-ensembles for offline reinforcement learning","venue":null,"work_id":"33972c54-b1ac-4765-859c-bd68f31bc91f","year":2024},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.159233Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:a4aa02118948aab56c62c34f04183c4583870cbde026077548ba8915ec35d9fe","observation_id":"b7214780-13b5-4915-a75a-6de01e8e131c","resolution":{"observed_at":"2026-08-07T12:56:30.703344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:30.667972Z","title":"Energy-weighted flow matching for offline reinforce- ment learning","venue":null,"work_id":"b3f554d9-c0cb-4341-ac55-a4ed021108a8","year":2025},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:30.265947Z"},"links":{"citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:48e0326b470114c14292c31d3043e0a4afc438531c14e275da2262fe018074fe","observation_id":"fd15f4a3-d5a5-42db-ba9d-5a09e4d6c2c5","resolution":{"observed_at":"2026-08-07T12:56:30.673893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T10:39:46.769874Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 34 inbound Pith citation observations for arXiv:2505.23458."}