{"as_of":"2026-08-21T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:850dabd22b3fe2b19dca3ce765a7b38e0b66d04bce28c537e088cbcfff57c41d","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:21:52.748214Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T14:36:10.359049Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T14:37:15.953758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"cited_work":{"arxiv_id":"2605.23365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.23365","snapshot_observed_at":"2026-07-10T14:37:15.953758Z","title":"Score-Based One-step MeanFlow Policy Optimization","venue":"cs.LG","work_id":"43a873f3-8ace-44b4-ae38-8d7a9e3aefe0","year":2026},"citing_paper":{"arxiv_id":"2607.07967","last_updated":"2026-07-08T22:42:29Z","snapshot_observed_at":"2026-08-17T03:32:32.080997Z","submitted_at":"2026-07-08T22:42:29Z","title":"Expressivity and Statistical Trade-offs in Diffusion Policy Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T14:36:10.359049Z"},"links":{"cited_paper":"/paper/2605.23365","citing_paper":"/paper/2607.07967"},"observation_digest":"sha256:fe23e67da59784cd8379264d02a8df9e4fa72839d581596ac5779f8829291f6a","observation_id":"c8575dd3-97fd-4132-989d-5617a15fd9d5","resolution":{"observed_at":"2026-07-10T14:37:15.956480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.23365/citation-record","integrity":"/paper/2605.23365/integrity","json":"/paper/2605.23365/citation-record.json","paper":"/paper/2605.23365"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":"2211.15657","doi":"10.48550/arxiv.2211.15657","metadata_source":"pith","pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","venue":"cs.LG","work_id":"dac365c0-e557-4886-9a1b-179151a66160","year":2022},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:8bb67d073c664a5fc1b2cb935cd2f303fe10d6c9a2fa8b19884de4d6793c401c","observation_id":"e16b1662-262e-4316-8611-47a11a2f0a76","resolution":{"observed_at":"2026-05-25T05:26:39.060227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:28.005241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:28.005241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iterated denoising energy matching for sampling from boltzmann densities","venue":null,"work_id":"dbe6602a-bdf6-42e2-947b-732d49c6ebf5","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:8060a91f41cdaeab7bb23f311b2cc8ce051c3aa122922ee2acdcbace3cd77ec2","observation_id":"fe2a9ef8-634b-4dca-a98e-0ff79b082d4e","resolution":{"observed_at":"2026-05-25T11:56:57.169906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":"8ca84fc6-5af1-4bf7-a164-5bd04c9b3ca1","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:880bdea129579429323c8bcf7fa8ba027c63de59876af89b2eb7b41030b00699","observation_id":"e835e503-70fd-45ff-b5ee-bae68fe6b10f","resolution":{"observed_at":"2026-05-25T11:56:57.150860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.696183Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"c9c072d9-9ac9-4cb5-9f63-6a558f9b5811","year":2025},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:70da6ca9258a0a616caea0bebbe87b190d0d9254fa3a401e0c2b41e6392244e6","observation_id":"dac36487-d07e-49c8-9cf7-6fcfb7e5e17d","resolution":{"observed_at":"2026-05-25T11:56:57.154017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":"79913409-189e-44e8-bd78-261cbc5d23ab","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:4f0642690dfec293adc3bea189e6e92d191e9b842403dc94586b634a5e1259bf","observation_id":"c6566601-a61d-4164-a854-fefbedd48cc9","resolution":{"observed_at":"2026-05-25T11:56:57.137898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One step diffusion via shortcut models","venue":null,"work_id":"4f42e9e1-d020-427d-8e01-1d512e512a83","year":2025},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:c029495186557bd9098556cca94789b37faffb1f0199b247e2ecc133414e86eb","observation_id":"c4fac339-7b83-440c-9ee2-ed955f3510f0","resolution":{"observed_at":"2026-05-25T11:56:57.156901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean flows for one-step generative modeling","venue":null,"work_id":"a6ddcb5a-b34e-430c-99ed-b86338f86535","year":2026},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:2b58c5d847e811350b99fb75d48843fb0b437c79e7cf93c18c90ae37aab6e509","observation_id":"4aebde4d-8f20-4261-b539-b27e5d06e10a","resolution":{"observed_at":"2026-05-25T11:56:57.160118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"16ad10c2-96b4-4dbb-b35a-59eb3000e37e","year":2018},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:6ed4f20584c73378b9ba4abaf2c0100dc892509bf460dca443b4fa8b90252ba6","observation_id":"80ca5bd5-9953-4cc2-b317-dd9e1246883c","resolution":{"observed_at":"2026-05-25T11:56:57.166758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"560243dc-b02c-471b-9ef5-46b5cfcff056","year":2020},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:8b3f84eba1b874ebb1a81c4a820541bb291ad7741d742c013ea59ce3f6cc93b3","observation_id":"e145d41d-209f-4da1-aa6a-88860d1d8024","resolution":{"observed_at":"2026-05-25T11:56:57.173743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-17T05:09:53.121073Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":"2205.09991","doi":"10.48550/arxiv.2205.09991","metadata_source":"pith","pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","venue":"cs.LG","work_id":"38b2c635-b754-412a-a8f5-dfcf3e405c95","year":2022},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:05b80fb0084a4c84c6f532ccf7ba32a01d0b10639e2d467af6d8c5af7b082d15","observation_id":"fb889358-7f67-45a3-a65c-8679d722f27d","resolution":{"observed_at":"2026-05-25T05:26:39.049945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.10881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prior-guided diffusion planning for offline reinforcement learning","venue":null,"work_id":"f83fa899-21e5-4954-b722-17cf5fcd346b","year":2025},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:22abdfecbed96e4fba243cc5db59b458c054a5263dd6569f0fe75e52a7d0fd9e","observation_id":"b6ac2a15-732d-442c-b150-1d29aa4051a7","resolution":{"observed_at":"2026-05-25T05:26:39.035451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.453010Z","title":null,"venue":null,"work_id":"c364286a-4be8-4dd9-a91c-bde2dcea06a8","year":2023},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:d16e99a53163c646301c1bf6159f4d573fdd37330489657efe0c4b768d72af98","observation_id":"492b20f6-9de9-4291-bda5-490666b1ca5e","resolution":{"observed_at":"2026-05-25T11:56:57.122735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"15bb922a-61a7-4ca8-bbb1-aa22019a2c4a","year":2023},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:ed2f21f7b2912d38df4f958f58ada6db75cb08fe9f9630944260d8863e414368","observation_id":"07029e77-d08d-4d2a-bac3-0bbb973597dc","resolution":{"observed_at":"2026-05-25T11:56:57.108656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models","venue":null,"work_id":"22cb7a3c-5899-4bcd-93b0-5a566e1c4b86","year":2025},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:b5a236f9423e3a0d97330f461e65b0fe51e3eaeed44bd74a7ae96d7890de0d52","observation_id":"d8c9407d-4691-446e-8b3d-fdb98f9f369a","resolution":{"observed_at":"2026-05-25T11:56:57.180228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":"7e5a4ede-37e7-41b7-b2b0-48af4294ff04","year":2025},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:bc59c09e734e57368bfe88f2cf187ad2e25c235c676cf54f6590dfce833e84e1","observation_id":"e791643d-1a99-4c84-a9fc-2adffdbb1539","resolution":{"observed_at":"2026-05-25T11:56:57.186599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":"c445fdaa-4acb-441f-9a64-97a301474f73","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:3e7fa5c5d01844e31d0c98d077d9789eeb8d7c0d59d3a8bd3a7b587a3395b17f","observation_id":"0b95ac95-a5d2-49c9-ab48-91457004b53e","resolution":{"observed_at":"2026-05-25T11:56:57.141016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:e0add1974658b998e5c0146526dbcebf008aff220fcae95e0091917cf2e5ba6f","observation_id":"dfd762db-b4d8-4092-912e-22a5e0bae85f","resolution":{"observed_at":"2026-05-25T05:26:39.040336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:53.310686Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":"2e825ee4-4769-4faa-a555-42a86cf98b15","year":2022},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:d3b76ad831110bb21dc024db81b1374e31398100f2a6d52113a176142cd4eef4","observation_id":"d6c1805b-c865-41ad-a931-fde69f2eb2e1","resolution":{"observed_at":"2026-05-25T11:56:57.119449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:314db3c68ef19dff0028489a7913961f56a62c4d326887b103ab96435e9bfa56","observation_id":"b8694883-1729-4fa4-a207-7653430550c3","resolution":{"observed_at":"2026-05-25T05:26:39.045159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:cc392a61b88d4c490a371a052cdb4beccc24bee143d7c3563f47d7f4d0a11247","observation_id":"f15f3bab-bf9b-4d07-bee2-f661700fecd3","resolution":{"observed_at":"2026-05-25T05:26:39.054865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:8feb42a06ce9578ca0233bb2b67a551612205b436f8dd2448da74074814366c6","observation_id":"7333592f-794c-4f02-bfc1-5aca43672304","resolution":{"observed_at":"2026-05-25T05:25:23.791074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Consistency models","venue":null,"work_id":"473d4653-ca01-498f-af4b-c197aeec3ba5","year":2023},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:43655ecb3a5b200bb0016423656f94b465bd3e758a11a48d058e3c408d39c6b0","observation_id":"763f04c7-b259-44b1-b986-4d16d979675a","resolution":{"observed_at":"2026-05-25T11:56:57.126168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:06:14.298150Z","title":"Generative modeling by estimating gradients of the data distribution.Advances in Neural Information Processing Systems, 32","venue":null,"work_id":"cb692d9d-db02-4ca4-a5ec-e39e8ee0487f","year":2019},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:e0a0210c09f5be818423103d7bb54188fb607dfa5648003f3ee3ab64a9de272f","observation_id":"8b9826e1-7c37-4249-807e-6aacddd5eddb","resolution":{"observed_at":"2026-05-25T11:56:57.177176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:53.229098Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":"a931f491-22aa-45be-b987-6cbef90feca3","year":2021},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:ed99aa7fc2d98bf38c3c19c2a095153c795fbb55a5d1ee56a194acc8d85b9e33","observation_id":"724ac68d-ab5e-4319-a08a-376234bc98d7","resolution":{"observed_at":"2026-05-25T11:56:57.147342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press Cambridge","venue":null,"work_id":"bbb6f25b-c1f9-457f-b875-7d53ea6f6e2b","year":1998},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:cd4c80ad637499950f5ddfb2cddb27a0c8cb317a968d9333951e68610381ebe7","observation_id":"589c7b6b-05c1-41fd-a090-a312414a711e","resolution":{"observed_at":"2026-05-25T11:56:57.115682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:17:32.727653Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"5946d158-4308-4d94-b6a0-414a6f6b0a87","year":2012},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:8622afc68abd8d80bda1f5bd8d938208200213bda1e9eb82c9c95244b090751d","observation_id":"0d1e467d-bd2a-4a05-968b-fa0232021a69","resolution":{"observed_at":"2026-05-25T11:56:57.183032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:af63aa0c6287ce556e3bcaf7a55a884e4aaaf3e719d8916454d0fbe71a637663","observation_id":"2fb51365-d222-4e43-98f5-7ba26eb10f64","resolution":{"observed_at":"2026-05-25T05:26:39.029853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion actor-critic with entropy regulator","venue":null,"work_id":"81999239-9c38-485e-bdec-fc29c80edb25","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:6e923df288fecc154d78cfc2549f16467215d78b13f0f8f2f6a25548a5df409b","observation_id":"8ccdbf9e-525a-4d85-b8e7-04ee27ca024f","resolution":{"observed_at":"2026-05-25T11:56:57.163332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:05:43.437766Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"7a853671-6f71-417c-89e6-2512a0010da3","year":2023},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:01c0e552ebd7f6cdb179cd428d67637f91c0c128aca0abf79608fc8cefb1887c","observation_id":"6fcb2bcd-c38f-441e-b0a7-ca7b2faff9cb","resolution":{"observed_at":"2026-05-25T11:56:57.130845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-21T00:59:12.585086Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2305.13122","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-07-10T14:37:15.947880Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":"cs.LG","work_id":"feb1bdbe-9bcc-4d51-8132-994b46f4d10d","year":2023},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:280466aafd8b2af8a42efdfc1b35223d952a966e998d036b6013dceaa2647599","observation_id":"c49ab6de-e540-40d5-97ee-f5641be5a5e2","resolution":{"observed_at":"2026-05-25T05:26:39.024863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":"674c5355-30a1-4045-b496-aa8ae66f9284","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:83a09a9e618aee9c1d28b53bcc6dc6cd72b9b6ff66efe33e405cf61353e5e184","observation_id":"e1970c2d-ee3b-4ff8-a082-f1acb63f6d56","resolution":{"observed_at":"2026-05-25T11:56:57.144048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean flow policy with instantaneous velocity constraint for one-step action generation","venue":null,"work_id":"ffbab14b-1467-4e38-90e1-6cdafa2c13de","year":2026},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:a01e8f939be650d713ea91e024ee29377bd41256a023ccb39f5ed3fbb93c45fc","observation_id":"1ffc8f5f-c9b4-4a12-86ba-e4dc119b479b","resolution":{"observed_at":"2026-05-25T11:56:57.134704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The final reward is given by the normalized mixture density, producing a smooth multimodal reward landscape with values in[0,1]","venue":null,"work_id":"ef73a327-72d0-4d57-9a0d-cd3139b9b65f","year":null},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:b7465150529abf5f6bea3e2b35e1a22d829d5f05956b1a8afa317bb2c7f5e7c1","observation_id":"23a9e2cc-d14d-47f3-95c9-589d4565155f","resolution":{"observed_at":"2026-05-25T11:56:57.112390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T05:41:21.776413Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":23},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2605.23365."}