{"as_of":"2026-08-18T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5de112c7db3476397c579a19a3e0a79ddcb235cb85e444d534ecf27d23aa8a4b","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:51.385352Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:32:46.531563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:07:27.693869Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12622","last_updated":"2026-05-14T17:59:01Z","snapshot_observed_at":"2026-08-11T16:49:04.149985Z","submitted_at":"2026-05-12T18:09:04Z","title":"Action Emergence from Streaming Intent","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-14T20:59:42.456958Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12622"},"observation_digest":"sha256:2da0ff44f1b039c182c5da2a2b6892eaaed7c95624026b41629d9580138026fc","observation_id":"e874a85f-4a32-4f77-a3f8-c478d703a54b","resolution":{"observed_at":"2026-05-14T21:02:59.187795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12622","last_updated":"2026-05-14T17:59:01Z","snapshot_observed_at":"2026-08-11T16:49:04.149985Z","submitted_at":"2026-05-12T18:09:04Z","title":"Action Emergence from Streaming Intent","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-15T05:13:44.795483Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12622"},"observation_digest":"sha256:865fc2437bcbf2f1595ee144134fd047c2ac0bf3c3cc5edc804e3fbf667046f7","observation_id":"fe907729-1795-43fd-91f1-a78dfba98a68","resolution":{"observed_at":"2026-05-15T05:15:02.985480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:50:14.602822Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:6cb6ef50cc1a8dbe33391bc78049345dbcecd7c5f1d461635567a1310605dbbd","observation_id":"62d7a1be-0619-455e-9ff5-92a6f45ac329","resolution":{"observed_at":"2026-05-14T20:52:58.729137Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2605.12625","last_updated":"2026-05-14T17:58:42Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T18:10:19Z","title":"Driving Intents Amplify Planning-Oriented Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T04:58:07.943615Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2605.12625"},"observation_digest":"sha256:d4d90d3cf41a056440e4521284704959b053e36870e3e377357e4e5139cf165f","observation_id":"98741778-00e8-48ec-8acf-970f908a4d18","resolution":{"observed_at":"2026-05-15T04:59:45.526358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2606.08602","last_updated":"2026-06-07T12:28:51Z","snapshot_observed_at":"2026-08-13T06:54:33.253501Z","submitted_at":"2026-06-07T12:28:51Z","title":"Reinforcement Learning for Flow-Matching Policies with Density Transport","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:55:02.040180Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2606.08602"},"observation_digest":"sha256:ac81fedccf5f77322315315f8abad776855e8ab80df9468bae5e9d5bedc49700","observation_id":"fd7edf9d-bae1-44d5-bba4-deb47f1c9f52","resolution":{"observed_at":"2026-07-02T22:27:25.812719Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-07-03T00:07:27.693869Z","title":"2505.14139 , archivePrefix =","venue":null,"work_id":"6e7dd84f-8dc4-4886-ba62-906ef39f8d04","year":2025},"citing_paper":{"arxiv_id":"2606.09115","last_updated":"2026-06-08T07:11:03Z","snapshot_observed_at":"2026-08-04T22:59:05.251199Z","submitted_at":"2026-06-08T07:11:03Z","title":"Counterfactual Transport Flows for Offline Conservative Trajectory Refinement","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T17:33:35.857240Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2606.09115"},"observation_digest":"sha256:eabf58fd50129081c49ee29d333a9b7ff040ee5081a17279a316bb2de1c568d6","observation_id":"96d8a000-fbb2-4097-9f99-a61a5978c4eb","resolution":{"observed_at":"2026-07-03T00:07:27.695520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-02T02:10:24.308093Z","title":"Flowq: Energy-guided flow poli- cies for offline reinforcement learning.arXiv preprint arXiv:2505.14139, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14424","last_updated":"2026-07-15T23:27:04Z","snapshot_observed_at":"2026-08-16T09:51:56.141462Z","submitted_at":"2026-07-15T23:27:04Z","title":"ConFlow: Constraints-Guided Learning with Flow Matching for Motion Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:24.308093Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2607.14424"},"observation_digest":"sha256:fe054c1213bb8db404bfcae437b024df801288d4d47b82ee0476fd4f0b77e7b7","observation_id":"01131813-7290-4a4f-9c57-d9c6c107e908","resolution":{"observed_at":"2026-08-02T02:10:24.308093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-01T14:19:59.991253Z","title":"Alles, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-16T12:20:22.787261Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.991253Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:f0de5730e97825f24a42d8b83f082dec0f84121213acaae1ce096f8697c09f26","observation_id":"7a705d2d-e3e4-42e3-aacb-279a33792de1","resolution":{"observed_at":"2026-08-01T14:19:59.991253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-06T00:32:46.531563Z","title":"arXiv preprint arXiv:2505.14139 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-17T03:46:01.250814Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:46.531563Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:dfdbde2c2250d2b6968129ccad3b1ddc0dbc3f7a18022515e26cdcfb0633b1d4","observation_id":"60624e1d-49e3-480b-8fb9-cd732ec8b0e6","resolution":{"observed_at":"2026-08-06T00:32:46.531563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14139/citation-record","integrity":"/paper/2505.14139/integrity","json":"/paper/2505.14139/citation-record.json","paper":"/paper/2505.14139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.119079Z","title":"Figure 5: Normalized return of FlowQ for the D4RL adroit environments using 5 seeds","venue":null,"work_id":"60632545-b8e7-4b92-9828-5aa76446dc8a","year":2025},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.385352Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:ef8d20c103591d7f62c57ef038799c19f0f33cb128454717ea64338b2948b159","observation_id":"f42ccfc9-013a-4bc6-bd91-727df8aa24da","resolution":{"observed_at":"2026-08-07T15:42:53.191140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-07T15:42:49.306851Z","title":"9 Linjiajie Fang, Ruoxue Liu, Jing Zhang, Wenjia Wang, and Bing-Yi Jing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.306851Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:6d7a525ee048ea24f96d420ffb6160b93a7df8cc5eef594c0e4a3bb0450bcd2c","observation_id":"3eb51ae0-f6dd-43b4-8f03-d419b8f68cdf","resolution":{"observed_at":"2026-08-07T15:42:49.306851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20555","last_updated":"2025-02-25T06:33:21Z","snapshot_observed_at":"2026-08-16T13:47:32.463914Z","submitted_at":"2024-05-31T00:41:04Z","title":"Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20555","snapshot_observed_at":"2026-08-07T15:42:49.396954Z","title":"Justin Fu, Aviral Kumar, Ofir Nachum, George Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.396954Z"},"links":{"cited_paper":"/paper/2405.20555","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:f9a078263d9ca11ba13e6d3007dc26525b0404fd88e73802c214b83b8e8c61ae","observation_id":"ca30f5ef-759b-47ad-97b6-76f6c65d8374","resolution":{"observed_at":"2026-08-07T15:42:49.396954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.288049Z","title":null,"venue":null,"work_id":"c5ba9834-df44-4dc4-b891-1a0ffa84f39a","year":2016},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.250242Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:08f488a6bf7086afe7b35b1cbfd364acb5a0226a8de44cde8478dffd13cc55e1","observation_id":"d918cf25-0e55-4308-86f0-0e6d2bc130c4","resolution":{"observed_at":"2026-08-07T15:42:53.391076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T15:42:49.782023Z","title":"Matthew Thomas Jackson, Michael Tryfan Matthews, Cong Lu, Benjamin Ellis, Shimon Whiteson, and Jakob Foerster","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.782023Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:db992249410f7fc81afe1e2be3997a2730c722224b375f7fd691636bd780b1ab","observation_id":"2bbb50df-d400-456e-8af2-26c74709b86c","resolution":{"observed_at":"2026-08-07T15:42:49.782023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T15:42:50.185601Z","title":"Aviral Kumar, Aurick Zhou, George Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.185601Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:54a53784828a9039e8a3102bc8e3637ee078556f3437cc99be748724de5baa36","observation_id":"3f9416a0-23a7-464b-9886-546706d16168","resolution":{"observed_at":"2026-08-07T15:42:50.185601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:53.520803Z","title":null,"venue":null,"work_id":"0812dca3-0db5-438f-8b61-d8d0c465e37a","year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.230127Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:6810dc52f34fd96a81d6cb15bd6c09d12a9912eea216fc690e08a2053f761f61","observation_id":"f4f97b07-d29c-440e-9072-8bd97f6c68f0","resolution":{"observed_at":"2026-08-07T15:42:53.607030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T15:42:50.314458Z","title":"Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, and Jun Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.314458Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:b675649d2b5241d8600dc78bac7e51681f78c07392c7e28e56982eb53173f916","observation_id":"5ab699ca-464f-46fe-a9f0-25cc41be7228","resolution":{"observed_at":"2026-08-07T15:42:50.314458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-08-15T11:10:42.406459Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-07T15:42:50.478554Z","title":"Seohong Park, Qiyang Li, and Sergey Levine","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.478554Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:2ba3957205395e4e973dd98a1065a849303f0312e8ac7d5be373a0c672711b4f","observation_id":"ccf2fe4e-d7b2-4ccc-9501-c01f458b10c6","resolution":{"observed_at":"2026-08-07T15:42:50.478554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11547","last_updated":"2020-12-21T18:28:17Z","snapshot_observed_at":"2026-08-16T18:56:55.811542Z","submitted_at":"2020-12-21T18:28:17Z","title":"Offline Reinforcement Learning from Images with Latent Space Models","version":1},"cited_work":{"arxiv_id":"2012.11547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.11547","snapshot_observed_at":"2026-08-07T15:42:51.952948Z","title":"Offline Reinforcement Learning from Images with Latent Space Models","venue":"cs.LG","work_id":"dca100c5-6682-40fb-8ade-0cf8e5012b36","year":2020},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.697409Z"},"links":{"cited_paper":"/paper/2012.11547","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:ca48a9099ec1d0bf11b43e25fa36ba4802cb182694ca33acf0f693472f15fd1d","observation_id":"f6a33093-fd25-4670-ac65-277f2c2119fc","resolution":{"observed_at":"2026-08-07T15:42:52.081987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-08-12T13:12:28.417467Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-07T15:42:50.747484Z","title":"Ziyu Wang, Alexander Novikov, Konrad Zolna, Jost Tobias Springenberg, Scott E","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.747484Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:bf37cac934064531355b1eb50b94e1a7eca6317551c53f702d9f3d32c4fab394","observation_id":"a72f762f-edd0-4573-b06c-85b28c7a4840","resolution":{"observed_at":"2026-08-07T15:42:50.747484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15134","last_updated":"2021-09-22T20:12:55Z","snapshot_observed_at":"2026-08-12T08:24:18.569918Z","submitted_at":"2020-06-26T17:50:26Z","title":"Critic Regularized Regression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15134","snapshot_observed_at":"2026-08-07T15:42:50.880303Z","title":"Tianhe Yu, Garrett Thomas, Lantao Yu, Stefano Ermon, James Zou, Sergey Levine, Chelsea Finn, and Tengyu Ma","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.880303Z"},"links":{"cited_paper":"/paper/2006.15134","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:d093eecf242a34a94016aef432d8cdf0f4ed8aab17d797b3622f37cca0dbb33e","observation_id":"17afe07b-bccf-4af8-a79f-d6f9e52682bd","resolution":{"observed_at":"2026-08-07T15:42:50.880303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13239","last_updated":"2020-11-22T07:04:17Z","snapshot_observed_at":"2026-08-06T03:32:02.156770Z","submitted_at":"2020-05-27T08:46:41Z","title":"MOPO: Model-based Offline Policy Optimization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13239","snapshot_observed_at":"2026-08-07T15:42:50.991836Z","title":"Shiyuan Zhang, Weitong Zhang, and Quanquan Gu","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.991836Z"},"links":{"cited_paper":"/paper/2005.13239","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:42c9fe9553be7ccf7aedf7a4773d3d85f4ce17d1a90a9d1cf2003c56c98016d1","observation_id":"502d693a-a891-43e7-bbff-f76c055b7b81","resolution":{"observed_at":"2026-08-07T15:42:50.991836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-08-16T14:41:09.188831Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-07T15:42:51.079534Z","title":"Wenxuan Zhou, Sujay Bajracharya, and David Held","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.079534Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:fbcea70b830017d815f088adeb27ea67fc68b6cd8da685e48cc2bae2e667ec64","observation_id":"1d271efa-623e-408e-b0e4-e9b8cec62007","resolution":{"observed_at":"2026-08-07T15:42:51.079534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07213","last_updated":"2020-11-14T03:38:38Z","snapshot_observed_at":"2026-08-16T19:05:56.095652Z","submitted_at":"2020-11-14T03:38:38Z","title":"PLAS: Latent Action Space for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2011.07213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.07213","snapshot_observed_at":"2026-08-07T15:42:51.547492Z","title":"PLAS: Latent Action Space for Offline Reinforcement Learning","venue":"cs.RO","work_id":"73916af9-f08b-4a61-8911-c35a8efa080f","year":2020},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.181002Z"},"links":{"cited_paper":"/paper/2011.07213","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:104c73dc215bec270c292a57f61ac42d805748658153250148bbc0fd6367ebd5","observation_id":"af01259c-5016-4578-a3d6-c356b6d41965","resolution":{"observed_at":"2026-08-07T15:42:51.700274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T15:42:49.723240Z","title":"Jonathan Ho, Ajay Jain, and Pieter Abbeel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.723240Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:1a46833b1d8c554c5bee01ea872cca22c5a147db676352a7c014bf3e27b64026","observation_id":"59abff0a-f10e-4b17-94a5-2c47107fb8ce","resolution":{"observed_at":"2026-08-07T15:42:49.723240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:42:50.038962Z","title":"Ilya Kostrikov, Ashvin Nair, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.038962Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:86b54a91f8a939e48a3cad9d4323e2f5cb011a01701563ab0b9bba5e7b0c6787","observation_id":"5b69c49b-924d-46e2-ab2e-3f2b5d10b17d","resolution":{"observed_at":"2026-08-07T15:42:50.038962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-14T17:47:09.064751Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-07T15:42:49.667242Z","title":"Dan Hendrycks and Kevin Gimpel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.667242Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:d0e94347e1fe13dbf7860f3c0092ebe3f2456f103185d6cb73424550f1fbccbb","observation_id":"832ce9c9-889f-4ad2-9cb1-0298b845ddf0","resolution":{"observed_at":"2026-08-07T15:42:49.667242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T15:42:49.466319Z","title":"Scott Fujimoto and Shixiang Shane Gu","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.466319Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:4b2eb334955b39bacce354eec46fa8fcd70fbccf20b5e20728afd8a8bca1e49d","observation_id":"6ad074b3-a6f5-4c12-80f5-3bfab2aa636f","resolution":{"observed_at":"2026-08-07T15:42:49.466319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06860","last_updated":"2021-12-03T18:58:09Z","snapshot_observed_at":"2026-08-16T18:17:35.064496Z","submitted_at":"2021-06-12T20:38:59Z","title":"A Minimalist Approach to Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06860","snapshot_observed_at":"2026-08-07T15:42:49.563459Z","title":"Scott Fujimoto, David Meger, and Doina Precup","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.563459Z"},"links":{"cited_paper":"/paper/2106.06860","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:e15d1af7775d74ecbdd982a5f55d81b86eb4422002f40ab799e6b5844c484078","observation_id":"5d26abf5-f678-4528-b515-ff9311f8250f","resolution":{"observed_at":"2026-08-07T15:42:49.563459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-16T16:55:48.381197Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-07T15:42:50.432520Z","title":"Cheng Lu, Huayu Chen, Jianfei Chen, Hang Su, Chongxuan Li, and Jun Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:50.432520Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:943c6742e6174c227140f8410a18c30161b029c2ea88393d66e11657f3a8abd5","observation_id":"54ffd1f8-04c3-4452-b03d-54da3fb97846","resolution":{"observed_at":"2026-08-07T15:42:50.432520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20081","last_updated":"2023-10-26T12:25:02Z","snapshot_observed_at":"2026-08-16T15:27:49.427159Z","submitted_at":"2023-05-31T17:55:21Z","title":"Efficient Diffusion Policies for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20081","snapshot_observed_at":"2026-08-07T15:42:49.907562Z","title":"Patrick Kidger and Cristian Garcia","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.907562Z"},"links":{"cited_paper":"/paper/2305.20081","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:157b85ea258aedbe88f98a136705dc0f96e9666d64d3665a7ff37c35c31f276f","observation_id":"f03702ea-474c-4204-8a39-dadc3920baeb","resolution":{"observed_at":"2026-08-07T15:42:49.907562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T15:42:49.234834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.234834Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:47194b0c2e8d587123deb42f25ac62c25e7cb0df82732e39e7add1628c35aaf4","observation_id":"95aabe8e-02c7-4362-98ad-c9865fc5b5cd","resolution":{"observed_at":"2026-08-07T15:42:49.234834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.04562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.771332Z","title":null,"venue":null,"work_id":"13a89b1b-8c30-48fb-8a7c-1b967f87b231","year":null},"citing_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:49.151820Z"},"links":{"citing_paper":"/paper/2505.14139"},"observation_digest":"sha256:a170fb150a70e15306295d641445d5a1e028509b26661d3a91866364a2e2746c","observation_id":"438fe611-de93-454e-8dc2-8f5980d3e5ae","resolution":{"observed_at":"2026-08-07T15:42:52.965404Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T22:28:18.522157Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 9 inbound Pith citation observations for arXiv:2505.14139."}