{"as_of":"2026-08-09T22:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f47b5b44e7384cef3613b9687f9912eff22db2b81024805519c78865110283c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:03:49.520373Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:27:31.026539Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:14.926116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"cited_work":{"arxiv_id":"2506.06261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06261","snapshot_observed_at":"2026-07-04T00:09:14.926116Z","title":"Reflect-then-plan: Offline model-based planning through a doubly bayesian lens","venue":null,"work_id":"93ed52c5-5021-4ac8-bf19-c1256b58c769","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2506.06261","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:3c083b27754e8be976527d511dccdde4b0852ce5bcebc92597016f922039e8b3","observation_id":"26f71b9d-ad91-4084-834d-b3d50183cc9f","resolution":{"observed_at":"2026-05-17T15:14:25.907040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"cited_work":{"arxiv_id":"2506.06261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06261","snapshot_observed_at":"2026-07-04T00:09:14.926116Z","title":"Reflect-then-plan: Offline model-based planning through a doubly bayesian lens","venue":null,"work_id":"93ed52c5-5021-4ac8-bf19-c1256b58c769","year":2025},"citing_paper":{"arxiv_id":"2606.19328","last_updated":"2026-06-22T15:12:05Z","snapshot_observed_at":"2026-07-06T23:54:37.596257Z","submitted_at":"2026-06-17T17:54:32Z","title":"UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:31.026539Z"},"links":{"cited_paper":"/paper/2506.06261","citing_paper":"/paper/2606.19328"},"observation_digest":"sha256:dccad7bda586b6691a1ddcae624e4a5b057929a2540bdb4abba5b81b54d7a93c","observation_id":"c1530e55-3dc4-43ea-861d-91ed9c3c525d","resolution":{"observed_at":"2026-07-04T00:09:14.928534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06261/citation-record","integrity":"/paper/2506.06261/integrity","json":"/paper/2506.06261/citation-record.json","paper":"/paper/2506.06261"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:44.662883Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.662883Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:ace01847b26edbbf0758a5174970959e3fac1c888a8322edf407689b55edb255","observation_id":"c8092b47-592e-4a82-b66a-cd0fce5fc801","resolution":{"observed_at":"2026-08-07T06:03:44.662883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:58.693963Z","title":"T., Tassa, Y., Munos, R., Heess, N., and Riedmiller, M","venue":null,"work_id":"e4013142-827c-4cf1-b457-94fd2daf1f2a","year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.734527Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:f051713c2ffb920dd98f040c9e6dc8915b3355e7b3f5ad2851989f728dc4b1db","observation_id":"c1e2bd2b-cdcf-4cf5-8a4c-2568b5e59295","resolution":{"observed_at":"2026-08-07T06:03:58.817378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13264","last_updated":"2022-01-05T18:45:18Z","snapshot_observed_at":"2026-08-09T12:42:37.599526Z","submitted_at":"2021-08-30T14:23:48Z","title":"Deep Reinforcement Learning at the Edge of the Statistical Precipice","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13264","snapshot_observed_at":"2026-08-07T06:03:44.808251Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.808251Z"},"links":{"cited_paper":"/paper/2108.13264","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:4d077a3098b541375df3a102acd7f7fbeec94c214475ad625c4a529a7a1212eb","observation_id":"22a2a20c-39f7-4aec-ad69-8d7dc93f94d7","resolution":{"observed_at":"2026-08-07T06:03:44.808251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:58.459662Z","title":null,"venue":null,"work_id":"e22be222-6ff3-402f-bca6-50b82c60fc78","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.892153Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:2e6001d518a318e93e6793d43c3c343c89311e13307fc9ea7ac6e542526d087c","observation_id":"05899d7e-9df4-4707-b93a-b9b427f6ea1e","resolution":{"observed_at":"2026-08-07T06:03:58.554367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:58.192616Z","title":"and Dulac-Arnold, G","venue":null,"work_id":"07e2dc14-cd01-4a73-b580-b86397312521","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:44.989810Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:4d4473cea41dd9046e89c59392e1aab8df325cf6e8a341c7e65284a35430ddad","observation_id":"f78c6806-41a6-42ce-bed7-7574043fae77","resolution":{"observed_at":"2026-08-07T06:03:58.335194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.886503Z","title":"Experiment tracking with weights and biases, 2020","venue":null,"work_id":"45dadfb6-ef6e-4720-99d8-3d6cdad46126","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.042792Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:68992f47631a25a93a6eb36216db7a908976f5c22c198e369526b87ce7b46157","observation_id":"46e4276a-0f8e-48b6-a9fa-e2bc0d3300df","resolution":{"observed_at":"2026-08-07T06:03:58.058084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.637115Z","title":"T., Wenjie, S., and Ye, J","venue":null,"work_id":"2e75ac27-e8e1-40c2-9470-8e659a5fa1d5","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.123090Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:5f9cbdbb3d7e0b0dd4597499e159330ae03f5679e0e49dbeba796389a956f184","observation_id":"9f0003b4-1283-495a-a48d-a56f1b787393","resolution":{"observed_at":"2026-08-07T06:03:57.739705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.415007Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"ea1daab4-6505-4e2c-9271-c451ebe4eda0","year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.201119Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:1ac83f4a2fcf2b1dcc5ef4607ab46a32c200180c8cef93fc533559b74495a0ed","observation_id":"ee9dc7b7-43f8-491c-b5c0-6781847d8ddc","resolution":{"observed_at":"2026-08-07T06:03:57.533127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:57.164921Z","title":"S., Abbeel, P., Levine, S., and Finn, C","venue":null,"work_id":"4efe3f55-e689-469d-aec1-c920c2c48bc8","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.285290Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:57d7258e2d2185804021b35c4b370e55a87dac8100bc562be59879b072fcaec1","observation_id":"9428f096-c1a4-48d4-8f2e-2aa7816e0afc","resolution":{"observed_at":"2026-08-07T06:03:57.285004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.858400Z","title":"Offline meta reinforcement learning -- identifiability challenges and effective data collection strategies","venue":null,"work_id":"c623746e-11af-43cc-bb2b-c2e998e6ed55","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.365659Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:6c92d77d9c20cd7550a34b7ce08f6fed25916fd7bf521c5d5567da5e8a97e18e","observation_id":"ca17b460-a715-47aa-8594-b91f28163e4d","resolution":{"observed_at":"2026-08-07T06:03:56.969870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.610745Z","title":null,"venue":null,"work_id":"07ab75e4-9fb3-4cfc-8f17-755e2eb5b238","year":2002},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.411352Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:e5000175b7e7a6885c9967c220f050dfd6a30169ba810074e7772c7398f67865","observation_id":"ab536021-8957-42d9-8dcb-f46a45381c51","resolution":{"observed_at":"2026-08-07T06:03:56.712428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T06:03:45.544896Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.544896Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:6f6ab950de835129fc1574a780548040df569c4044b0f91053fccdc0dec0e6a7","observation_id":"4c5c8bac-27bf-41dc-8dc2-08557a1ec706","resolution":{"observed_at":"2026-08-07T06:03:45.544896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:45.611725Z","title":"and Gu, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.611725Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:813d45763268c199720b17ef661cb895e5754de41c123abd9f804aa3ffc19d0b","observation_id":"b76c7758-8e57-4861-9361-d4dd75684348","resolution":{"observed_at":"2026-08-07T06:03:45.611725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.286114Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"52bae9a3-bcb0-457e-ac96-b01511460748","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.696943Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:23895afc460830c62a6b6909bf8270f073b8ca2efbc3e5fb7d798d1281778209","observation_id":"b7b5d722-cb99-4da3-b011-02228b4b32f4","resolution":{"observed_at":"2026-08-07T06:03:56.465987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:56.029820Z","title":"Bayesian reinforcement learning: A survey","venue":null,"work_id":"0912f4d5-2e31-4720-81fd-9550f7ef5440","year":2015},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.765536Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:46fa65a96e7f92638bcd31f39ec2bfc6a4943bd8f3164e96776d8ebfda178240","observation_id":"c639d093-f020-46bd-81ab-9e58b7ccd681","resolution":{"observed_at":"2026-08-07T06:03:56.146775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:55.716431Z","title":"P., and Levine, S","venue":null,"work_id":"710210ae-2bc0-45b4-976c-0f5c7483a15a","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.831667Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:7651e2734d1cb74040f5273ce15d53b6fffb3e235555898b2eee32d802bdd11a","observation_id":"f6fef5e4-79ef-4c5d-ba64-f1a2869dbb01","resolution":{"observed_at":"2026-08-07T06:03:55.861945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:55.431059Z","title":"Offline RL policies should be trained to be adaptive","venue":null,"work_id":"da4b42dc-28db-45c7-b518-b95fb4a47aa8","year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:45.937699Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:a666b8063c8bf420376bbde63a2e800294eb624a2f50364f876cf6d7799a6abe","observation_id":"27827645-388a-40b6-9c8a-672b7ecd6df1","resolution":{"observed_at":"2026-08-07T06:03:55.550935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"file/3505107","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:50.635773Z","title":"Efficient bayes-adaptive reinforcement learning using sample-based search","venue":null,"work_id":"d44d3009-6546-479b-9867-c50183b16add","year":2012},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.012409Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:c9b6194dae16fa0df6181f243829bc7b0c6d072babfa3cff8a394c0d751da5cf","observation_id":"321a86f3-abf5-44f5-8209-44aef3c51753","resolution":{"observed_at":"2026-08-07T06:03:50.770223Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:55.125312Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"e651c05a-026c-4fb3-bce1-e50f12e26ede","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.096762Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:3266137ade8603f7ef5c5f5c31c892af54ffaea18020c2d080d858abccc8ba7b","observation_id":"705bd01e-1c79-4bfe-a40d-afbf8fe81c58","resolution":{"observed_at":"2026-08-07T06:03:55.308363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:54.797517Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"01b1d33f-dff4-4d26-ae06-327f7abb8c46","year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.183550Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:312303ce0f19278a3f1b0d166f9359953148a9fa2ad46e5e4b1c16327821e63b","observation_id":"42ad2618-6304-40fe-b34f-6df7def337bc","resolution":{"observed_at":"2026-08-07T06:03:54.959745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:54.492913Z","title":"Is pessimism provably efficient for offline rl? In Meila, M","venue":null,"work_id":"7f6a23d3-5358-4755-b826-76ee83bcf1b6","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.260650Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:e533d6210d4b563ccf163258dd9aa86b4f1398bff6b6e076e81356c174ab8038","observation_id":"0ab800cf-6a1f-4238-bbc1-dfc6983d4a9c","resolution":{"observed_at":"2026-08-07T06:03:54.657314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:54.176369Z","title":"P., Littman, M","venue":null,"work_id":"b59fb58c-5714-4e29-8f40-350656c790c5","year":1998},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.347403Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:eadfd1603036d01210b5743397a0bdad1bd94b3e7623a815768dcc296572180d","observation_id":"ca289220-e219-4c8d-96c5-209ad2b4d40e","resolution":{"observed_at":"2026-08-07T06:03:54.324634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:53.807662Z","title":"Morel : Model-based offline reinforcement learning","venue":null,"work_id":"c54439e1-8556-42a9-afd4-e991f40fc40f","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.452733Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:7bc475a39db0975e44a6b4e57f97984f5f95298d5f77faefaff214882b36528c","observation_id":"0ba19711-98f1-4007-9ad5-5c42e5c10026","resolution":{"observed_at":"2026-08-07T06:03:53.981841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:46.549158Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.549158Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:8f173e53293df712316e7345c12f088b7f56b055c7b57752b74277cc324ff1f7","observation_id":"dd60bff0-8a58-4589-850d-21e8f415fd4d","resolution":{"observed_at":"2026-08-07T06:03:46.549158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:53.500938Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"828c88be-27c3-4c7d-becc-ed49a9ae1c65","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.664728Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:c00c1f542a45550969fa7b65dca23e08f33f70710e477c9bb17abbe03d4ea124","observation_id":"55e25cb3-2daf-442c-bced-130b23261ac5","resolution":{"observed_at":"2026-08-07T06:03:53.649910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:53.152494Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"21ac1f9d-8d7f-4a5a-941f-91790363b471","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.791841Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:5e281bf366b0c37068fe9fc05802b6b252e9d2e4401ceaed040d36fc417a3de0","observation_id":"a226a1e9-50ab-4673-abec-69396cd17915","resolution":{"observed_at":"2026-08-07T06:03:53.293634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:52.841435Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review, 2018","venue":null,"work_id":"b598de1a-a41a-4d54-98b4-3f6ffaf2e606","year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:46.990592Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:8debf8ed1a1c0200178c36492591ef79db9720a26b5fd2bd03a0b94d9c600d32","observation_id":"b3e38fe3-479d-4d2b-97b8-d3cc76116f40","resolution":{"observed_at":"2026-08-07T06:03:52.991334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T06:03:47.167284Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.167284Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:312ba825524c96911c1caf949ee6f8271ecc95361fd42f5dd3dc20813273c170","observation_id":"d0d22f6d-3053-4300-8c3b-b4cbd78b069d","resolution":{"observed_at":"2026-08-07T06:03:47.167284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01848","last_updated":"2019-01-28T16:39:23Z","snapshot_observed_at":"2026-07-06T07:12:44.495733Z","submitted_at":"2018-11-05T17:09:18Z","title":"Plan Online, Learn Offline: Efficient Learning and Exploration via Model-Based Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.01848","snapshot_observed_at":"2026-08-07T06:03:47.372549Z","title":"Plan online, learn offline: Efficient learning and exploration via model-based control, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.372549Z"},"links":{"cited_paper":"/paper/1811.01848","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:e5eedcd2546c4743f4608c0e6028d856b3e94f02bd0e8ecefffab3c8f5ccfbd8","observation_id":"e95f3e36-e84f-46ae-b63d-338187ba32a5","resolution":{"observed_at":"2026-08-07T06:03:47.372549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:52.535617Z","title":"Revisiting design choices in offline model based reinforcement learning, 2021","venue":null,"work_id":"f9184d9b-e73c-4d57-9e84-a5b1754a5f1c","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.506550Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:0ec16129e4b7eb926c9fc43fef38bec66976af95980e4eca2274de067aab14c3","observation_id":"e17cfde7-9275-4d2c-bf81-faf758631575","resolution":{"observed_at":"2026-08-07T06:03:52.717159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11652","last_updated":"2019-09-25T17:55:37Z","snapshot_observed_at":"2026-07-06T08:24:35.659730Z","submitted_at":"2019-09-25T17:55:37Z","title":"Deep Dynamics Models for Learning Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11652","snapshot_observed_at":"2026-08-07T06:03:47.644501Z","title":"Deep dynamics models for learning dexterous manipulation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.644501Z"},"links":{"cited_paper":"/paper/1909.11652","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:0d5a5928813a526e5046984842ccf87a53cb35a1f6f03d69823d5d417452d237","observation_id":"8de4fcca-fc38-43a3-a230-aa0ca047e3ea","resolution":{"observed_at":"2026-08-07T06:03:47.644501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:52.164569Z","title":"and Taniguchi, T","venue":null,"work_id":"1d83eac1-e9f5-4584-aa43-2459527d81ea","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:47.808954Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:29995e2b129eb55a62625363a52ade3e7c333a729b49910381f4681e3ef6da3c","observation_id":"3425e546-0fed-405c-9f01-b5c0be6bdda4","resolution":{"observed_at":"2026-08-07T06:03:52.311287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:51.860505Z","title":"Probabilistic planning with sequential monte carlo methods","venue":null,"work_id":"a8ff20db-aa2e-4b76-965d-a650bc332651","year":2019},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.015339Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:43b2fa536064e7433b5602732428dc723c9985b0fc01c2e914d8e1b3adeaaaed","observation_id":"76999567-9b58-4024-a5a9-a64c44821feb","resolution":{"observed_at":"2026-08-07T06:03:52.002407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12581","last_updated":"2022-10-11T06:19:27Z","snapshot_observed_at":"2026-07-06T13:04:06.153900Z","submitted_at":"2022-04-26T20:42:14Z","title":"RAMBO-RL: Robust Adversarial Model-Based Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12581","snapshot_observed_at":"2026-08-07T06:03:48.178163Z","title":"Rambo-rl: Robust adversarial model-based offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.178163Z"},"links":{"cited_paper":"/paper/2204.12581","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:26281826772966ead94f1be807cb62e58208ac24a1dba58420424129951a9c86","observation_id":"3dcb864d-2bad-4af4-8797-ee40806379e7","resolution":{"observed_at":"2026-08-07T06:03:48.178163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:51.508837Z","title":"Learning off-policy with online planning","venue":null,"work_id":"cdd9d75f-23bd-4b19-8f9d-e11d77a111bb","year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.345210Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:f4d32e00043e4bb3eb271639cb3f99e1dd09b5dd932f526d5c1e8192ef70c6de","observation_id":"6b04e500-2cc4-4f42-87c8-27ab9d7706b4","resolution":{"observed_at":"2026-08-07T06:03:51.673944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9469.00360","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:50.050115Z","title":"Improved sampling-importance resampling and reduced bias importance sampling","venue":null,"work_id":"5b65c111-7e72-4526-bd2b-fe2313d72f71","year":2003},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.477888Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:ccbf193492d9bc89bca76eecd8f1a3d78b80e6bd620eff0c7153357c4961cd21","observation_id":"300b965f-9130-4fc9-bd52-e230fd1425a8","resolution":{"observed_at":"2026-08-07T06:03:50.402148Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:48.624377Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.624377Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:a78958bf602047f04be57857bcf9290772071e2a70238aa5b5767a07dcbb23ab","observation_id":"2d6978e4-bf2e-413e-9d8d-5540e253e3ac","resolution":{"observed_at":"2026-08-07T06:03:48.624377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:51.120526Z","title":"Model predictive path integral control using covariance variable importance sampling, 2015","venue":null,"work_id":"fbb72d20-b88a-45b4-99ce-512be247bee9","year":2015},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.752678Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:86f426d8d4e0e329ff026c3e598a9205b8f0b0f698a77d2cea7904ca1ab11753","observation_id":"85faaf2e-b21c-4330-83d4-9a7482d1a1f0","resolution":{"observed_at":"2026-08-07T06:03:51.303992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T06:03:48.860136Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:48.860136Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:7eea119da5c6416494de3b59bcb882b0284d162be5199bd01bf5a5854e3a304d","observation_id":"6c80e0e6-da96-4a3c-8da9-f2437ea0e9a8","resolution":{"observed_at":"2026-08-07T06:03:48.860136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:50.887820Z","title":"Mopo: Model-based offline policy optimization","venue":null,"work_id":"dfe70d2a-5110-4fc4-8896-1006fcce174c","year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.021233Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:d4763bdc4cd807f3cb56e3ba5faed163e52ba61efcf08b35f590905998c2aaf4","observation_id":"7f0ae814-39de-4658-a455-60ce2bad1014","resolution":{"observed_at":"2026-08-07T06:03:50.976072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08363","last_updated":"2022-01-27T01:08:41Z","snapshot_observed_at":"2026-08-05T09:11:42.032958Z","submitted_at":"2021-02-16T18:50:32Z","title":"COMBO: Conservative Offline Model-Based Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08363","snapshot_observed_at":"2026-08-07T06:03:49.226355Z","title":"COMBO: conservative offline model-based policy optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.226355Z"},"links":{"cited_paper":"/paper/2102.08363","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:4cc51bb656ecc634470eac11fad556ed8d5be8c36de446bbef25226d11605afd","observation_id":"40591d21-29e5-46d1-b52f-9a758d043e95","resolution":{"observed_at":"2026-08-07T06:03:49.226355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/516","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:49.699538Z","title":"Model-based offline planning with trajectory pruning","venue":null,"work_id":"a28d3cf0-8f24-4434-8248-fa6676d2114f","year":2022},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.380210Z"},"links":{"citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:b6d9cd290cecc712fe5527d694957a3fbc51f640d13b696b35253f40ea87e17e","observation_id":"377ac002-9335-4d18-923f-0e1bace05914","resolution":{"observed_at":"2026-08-07T06:03:49.820614Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-08T16:00:49.075701Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-07T06:03:49.520373Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta-learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:49.520373Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2506.06261"},"observation_digest":"sha256:65b7f386999c2c37cdfea9762bb74f679f325a2e284c3fadcc734a29165a4351","observation_id":"c4e594ae-0268-48e9-92cc-2d4f6d18b387","resolution":{"observed_at":"2026-08-07T06:03:49.520373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06261","last_updated":"2025-06-06T17:40:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T12:43:59.901411Z","submitted_at":"2025-06-06T17:40:12Z","title":"Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2506.06261."}