{"as_of":"2026-08-15T19:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21a7740a8f74ee10879a63f327ce6cc79347bc45c39f35e3621dd79c91415707","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:16:05.159203Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:25:39.829506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T01:48:51.121586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.22442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22442","snapshot_observed_at":"2026-07-17T00:20:38.764461Z","title":"Tree-based batch mode reinforcement learning.Journal of Machine Learning Research, 6","venue":null,"work_id":"cdcca974-d030-4895-811b-974fee853cc6","year":2005},"citing_paper":{"arxiv_id":"2512.04341","last_updated":"2026-05-01T06:11:28Z","snapshot_observed_at":"2026-08-12T14:29:14.504650Z","submitted_at":"2025-12-04T00:07:08Z","title":"Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:16.923948Z"},"links":{"cited_paper":"/paper/2505.22442","citing_paper":"/paper/2512.04341"},"observation_digest":"sha256:e69c1e019dd3031d6421d812836fee1d4e9bf36fd6aa47c6adb159fb1df345dd","observation_id":"7a38f31e-998b-44d0-a06c-e8f6a48dbd1e","resolution":{"observed_at":"2026-07-17T00:20:38.764461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22442","snapshot_observed_at":"2026-08-05T15:25:39.829506Z","title":"and Foerster, Jakob N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03644","last_updated":"2026-08-04T13:29:00Z","snapshot_observed_at":"2026-08-11T03:36:19.110855Z","submitted_at":"2026-08-04T13:29:00Z","title":"Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:39.829506Z"},"links":{"cited_paper":"/paper/2505.22442","citing_paper":"/paper/2608.03644"},"observation_digest":"sha256:d0507d7b061e3fc52e0a57cbaf4f85625c7254d91a1974e979cc9885a33ed3c5","observation_id":"00b3f2c1-259b-40d1-9384-9e49144431e9","resolution":{"observed_at":"2026-08-05T15:25:39.829506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22442/citation-record","integrity":"/paper/2505.22442/integrity","json":"/paper/2505.22442/citation-record.json","paper":"/paper/2505.22442"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2335509","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:09.332000Z","title":"Aitchison","venue":null,"work_id":"bb40ac82-c6ff-4f24-a2ce-0eab62914a8c","year":1975},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.315944Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:5832ec790734fd957ca9d4e6d23e2a29213541eed8f5cfca3483d1a603c0f9f4","observation_id":"7f4fa7dd-2576-4833-918f-082dad491144","resolution":{"observed_at":"2026-08-07T13:16:09.424246Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.28482","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:08.904488Z","title":"Alaa and Mihaela van der Schaar","venue":null,"work_id":"ecb187b7-75d5-4a94-8637-07951c5c502f","year":2018},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.356190Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:c287febe7ddc59f68f1543b2ce1cb9d9ef24d388c32d6daf62eb1acb2bce86a4","observation_id":"aa23fa33-78ea-43be-ad09-ec04a2ec318a","resolution":{"observed_at":"2026-08-07T13:16:09.081121Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.413976Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.413976Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d16a36c422d6d08586c1d696ef3bff56b57ce0b78df31f388e0f3a792fe94d78","observation_id":"faa3004a-74fb-466a-b59d-28e8b50b6332","resolution":{"observed_at":"2026-08-07T13:15:57.413976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.474090Z","title":"Asymptotically minimax bayes predictive densities.The Annals of Statistics, 34(6):2921–2938, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.474090Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:bfa3eeef67545561722ea662df2c17b8c61d0b6b1a104b5c23ceb961e8dafe2c","observation_id":"3ad69933-f655-4d69-8dee-5f498d7ff47c","resolution":{"observed_at":"2026-08-07T13:15:57.474090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.536060Z","title":"Augmented world models facilitate zero-shot dynamics generalization from a single offline environment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.536060Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:300d8eb2ff4b022e9144645fb48c346ed9b3e2fb11418b64959682ea2f95ad8b","observation_id":"02430707-3cef-41eb-acea-41eedfcd62cc","resolution":{"observed_at":"2026-08-07T13:15:57.536060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.137264Z","title":"Information-theoretic characterization of bayes performance and the choice of priors in parametric and nonparametric problems","venue":null,"work_id":"d82b5eaf-4971-4a8a-bba2-e1348ef3d50e","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.590263Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0d9c212b5253fb969489965b0fe10de2d305050287c3b5fc3eb778ed634b8211","observation_id":"b48111ec-9df1-470f-b256-4122791e1c06","resolution":{"observed_at":"2026-08-07T13:16:21.255216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.917214Z","title":"Barron.The Exponential Convergence of Posterior Probabilities with Implications for Bayes Estimators of Density Functions","venue":null,"work_id":"b159d467-5c04-4406-a744-56abfed36776","year":1988},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.757860Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:33c98bcb5b0e5338c3ad6ab0ad03b16bccc24ebc357f87f6f427f8a462a89236","observation_id":"ab150b87-375f-4aca-b853-765cb9f73e2f","resolution":{"observed_at":"2026-08-07T13:16:20.989180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.729392Z","title":"Bass.Real Analysis for Graduate Students, chapter 21","venue":null,"work_id":"94a13861-4868-49a8-90da-abae6f545db7","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.822068Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0730c1a93e557bcf7ff9aedc1681475e4575409f124dbeef374765d42a82ced4","observation_id":"d16ea67a-4b7d-4dcf-83cb-b64d4ddd1675","resolution":{"observed_at":"2026-08-07T13:16:20.820274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-13T13:01:56.349327Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-07T13:15:57.942175Z","title":"A survey of meta-reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.942175Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8d8cb17d82474ed17ff1c4e2992add6870d27f745de08e7c5c9b7ef92a0422d3","observation_id":"14fff60b-933b-4eff-8483-c0f9dc237f61","resolution":{"observed_at":"2026-08-07T13:15:57.942175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2504827","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:08.290104Z","title":"A problem in the sequential design of experiments.Sankhy ¯a: The Indian Journal of Statistics (1933-1960), 16(3/4):221–229, 1956","venue":null,"work_id":"4006ff56-b21e-4066-8931-a81faf79e510","year":1933},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.001783Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:923db592fe9a1d3d1d9b43901bddb6e987b575d909e5710b560ee5079ca6cada","observation_id":"c275b9b1-b9bd-4ad5-a6de-e2c89d65fe86","resolution":{"observed_at":"2026-08-07T13:16:08.501815Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.052512Z","title":"Dynamic programming and stochastic control processes.Information and Control, 1(3):228–239, 1958","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.052512Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:44bb884e86b8d548e858de477d37ef9a5d1d03c531ea10e59002fcf7266cb68c","observation_id":"53dbe3be-d34e-4b8f-b8c4-eeae6d108a02","resolution":{"observed_at":"2026-08-07T13:15:58.052512Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.364163Z","title":"Foster, and Daniel M","venue":null,"work_id":"38ce90a8-a484-4da1-a41c-593f6b4cc931","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.116894Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d00d709283a25f9de96c1abb4bf2639a741c065a87150e54bbc59c121cf4db3d","observation_id":"ad5273c6-cfb0-4297-8b5b-d36395eea30e","resolution":{"observed_at":"2026-08-07T13:16:20.427736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.171525Z","title":"On the foundations of statistical inference.Journal of the American Statistical Association, 57(298):269–306, 1962","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.171525Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:25a0ac8540cfcef167370e9b23dcf906ba5d2154d2293a0d3d9749ff3f06e196","observation_id":"3f3dade5-de7b-468d-8deb-ae49eabbfc43","resolution":{"observed_at":"2026-08-07T13:15:58.171525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.229703Z","title":null,"venue":null,"work_id":"b817ca3c-0067-4bb9-a8a5-932c419ff83d","year":1978},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.236104Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0ab0a71fb7fab4b67114826262e1ae290a920f7514c1f0a8344651ad4a74c414","observation_id":"50ccbea6-642b-4c41-abfb-6ccd7d75f62c","resolution":{"observed_at":"2026-08-07T13:16:20.279450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.072411Z","title":"Bayes adaptive monte carlo tree search for of- fline model-based reinforcement learning, 2024","venue":null,"work_id":"2bcae4a6-2ff2-496f-b7de-e8fe23acf971","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.297640Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a8da8047a73f2ece096f507defb327f025224b8e48e4e4acc275281b6b4e2379","observation_id":"de0a4ee4-4b43-46b8-9c14-1c86432ce338","resolution":{"observed_at":"2026-08-07T13:16:20.135149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.867089Z","title":"Conser- vative uncertainty estimation by fitting prior networks","venue":null,"work_id":"6fd6d1e5-20bf-4618-821d-9a509e3b2f41","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.372662Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0e5cc6cfa73d8dbcb6dd0560b4a2867b6a5cc9e1416c556296bdc68ce79f29bb","observation_id":"cfe50663-3e99-4113-815f-551afb1c29ee","resolution":{"observed_at":"2026-08-07T13:16:19.983352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.649951Z","title":"Clarke and A.R","venue":null,"work_id":"d5fd4864-c8b4-4124-ab18-dbe2c39e642f","year":1990},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.448968Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8ff984318f91d87bc9735ff747d368df86786d857ac468c9c8c11be749967a10","observation_id":"016295ea-6bda-4420-99f2-2c9d7ae85950","resolution":{"observed_at":"2026-08-07T13:16:19.743980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0041.45101","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:07.846812Z","title":null,"venue":null,"work_id":"93ddcd37-1ee8-42d1-ac73-051400b25bc9","year":1949},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.500423Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:79caf9b4b3a22627c93203fa77c1ae6c686d4ddcaf106d22558803074f298f99","observation_id":"4ba4c40f-40e6-47f5-a44a-23eb99b56a5f","resolution":{"observed_at":"2026-08-07T13:16:07.959162Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.441651Z","title":"Observation of a markov process through a noisy channel.PhD Thesis, 1962","venue":null,"work_id":"ea296458-e389-4ef0-a21d-799fb986ff93","year":1962},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.563857Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:03ef6b194756d836ec2683d149192d54aa78ae2fce758abd69d03edae59e0c9c","observation_id":"54158c56-5f57-431f-be73-7a763611224d","resolution":{"observed_at":"2026-08-07T13:16:19.551859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.220849Z","title":"Fast reinforcement learning via slow reinforcement learning","venue":null,"work_id":"8f2e96f3-6ec4-46cd-bd4e-dc5892af0785","year":1987},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.618468Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ad8e014b9d6694e045528f71c3b67a64d032b40ba4a67bd005f820cd1af8bce2","observation_id":"d5475ef1-f8d4-4265-9802-3e75ba2d6176","resolution":{"observed_at":"2026-08-07T13:16:19.341391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.017153Z","title":"PhD thesis, 2002","venue":null,"work_id":"717211a5-c5e0-49b3-814c-7d9b2661ec97","year":2002},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.684957Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:fb71cfc85ab0216426e80cd9326ab301abc12269d5c69cd629d32ab10737efe5","observation_id":"fd95ba64-4cef-4f53-a399-142fcde22945","resolution":{"observed_at":"2026-08-07T13:16:19.101212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.843589Z","title":"Bayesian exploration networks","venue":null,"work_id":"6360d503-ad3f-4989-801c-4a5f162ba409","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.801124Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9bfb9d62e0af249f16ccba5c42d3974a8979015a290e0bcad27135d0e602be4a","observation_id":"b34d3302-8720-46c0-88bf-8404861c1c57","resolution":{"observed_at":"2026-08-07T13:16:18.931137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.586491Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2020","venue":null,"work_id":"6e3f2253-3a80-49c0-8084-4c1b6dea5e9d","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.874936Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:2af2d51895072f1a14c23ba32356b18cade59e211278a055de4c66579ee76382","observation_id":"af8f42f6-eebf-41e4-a8ed-29b0c9113c05","resolution":{"observed_at":"2026-08-07T13:16:18.703635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.358105Z","title":"A minimalist approach to offline reinforcement learn- ing","venue":null,"work_id":"e660881a-5c4b-4a21-a692-00be526b5f2b","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:58.962879Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8caad676fbda5d22777c64fab6848918ee13245cd164f7d89fc27e6d3f777996","observation_id":"37eca544-1166-4b74-b6d2-90890599c766","resolution":{"observed_at":"2026-08-07T13:16:18.497264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/bjps/axt039","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A new proof of the likelihood principle.The British Journal for the Philosophy of Science, 66(3):475–503, 2015","venue":"The British Journal for the Philosophy of Science","work_id":"bd565944-385f-45c4-983a-f14ad907a873","year":2015},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.057545Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:96a8ab2702dd8de203ad71c6e7511d04e5f581afd8c565dc26276e53fbacb800","observation_id":"b819815a-87ac-40bc-8d62-8771f3c71ef1","resolution":{"observed_at":"2026-08-07T13:16:06.339819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.120553Z","title":"Efficient bayes-adaptive reinforcement learn- ing using sample-based search","venue":null,"work_id":"8cb22b59-929d-493a-93ee-98b153c3741d","year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.158171Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:60322aaa4f06b1cc7e5fc5e132177f79829ffe968bf5508f6f85c95534ee54e5","observation_id":"ef74a39f-c140-461e-9299-238a9cacd29d","resolution":{"observed_at":"2026-08-07T13:16:18.234691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.4117","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Scalable and efficient bayes-adaptive reinforcement learning based on monte-carlo tree search.Journal of Artificial Intelligence Research, 48:841– 883, 10 2013","venue":"Journal of Artificial Intelligence Research","work_id":"a702c269-a083-4947-a1b9-b3aedfe46286","year":2013},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.266350Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:6fe44dfcdda93f2fba4e918bf37425749ec99ce9897675e3bfc3a5de74f22099","observation_id":"66c454f4-a472-49ce-9f75-be6bfcf5830a","resolution":{"observed_at":"2026-08-07T13:16:06.134303Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.933779Z","title":"Bayes-adaptive simulation-based search with value function approximation","venue":null,"work_id":"2c38580d-95ef-4e97-91f4-463fd0ec12c7","year":2014},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.378247Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9d72e2544f6dc73456923311fa4477c20eff6b4f3f9b9eee60c692cb788f64f2","observation_id":"5ae9635e-e761-4966-9f5c-475929cbdaa3","resolution":{"observed_at":"2026-08-07T13:16:18.029970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.685188Z","title":null,"venue":null,"work_id":"c31cc647-c719-4708-b19d-32b92f2df5e9","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.456794Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:026edf471eff48a3102da8e9fc978c74e8c1fd83e0ea64af6f1369ac364c0e6e","observation_id":"0bf909f1-3bb1-4868-9454-17edfad43c83","resolution":{"observed_at":"2026-08-07T13:16:17.800520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11453","last_updated":"2025-04-15T17:59:05Z","snapshot_observed_at":"2026-08-07T16:02:04.620546Z","submitted_at":"2025-04-15T17:59:05Z","title":"A Clean Slate for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11453","snapshot_observed_at":"2026-08-07T13:15:59.584911Z","title":"A clean slate for offline reinforcement learning.arXiv preprint arXiv:2504.11453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.584911Z"},"links":{"cited_paper":"/paper/2504.11453","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:7fecaada7fda0083dd19b3061d3d488bc7c3a4726e86ca280cd6716b24821e5d","observation_id":"9d4a2e4d-9dec-438c-8374-ef6516ec5cf1","resolution":{"observed_at":"2026-08-07T13:15:59.584911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.367419Z","title":"Relu to the rescue: Improve your on-policy actor-critic with positive advantages","venue":null,"work_id":"4cedf99b-41d0-4518-97b6-6ff31ce56792","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.840841Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a76c5a2f29cc87aea991cb8f47186814dc5624966d9e4eb6e9c49fd2fc4e83be","observation_id":"cea3e1a3-04be-4a0e-b586-9593314cd513","resolution":{"observed_at":"2026-08-07T13:16:17.425672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.177348Z","title":"Littman, and Anthony R","venue":null,"work_id":"69afb3d8-2814-40b7-bb8e-d08bd4355241","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.939273Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:4e499432871835f20b91c88f28eea97231e39dce9057f5efa1c3f2fe29c4eba1","observation_id":"3d7c401b-dbee-484d-97e6-317c68901b68","resolution":{"observed_at":"2026-08-07T13:16:17.259390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.017044Z","title":"The validity of posterior expansions based on laplace’s method.Bayesian and Likelihood Methods in Statistics and Economics, pages 473–488, 1990","venue":null,"work_id":"bf739748-0a07-4bdf-a566-395f545b134e","year":1990},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.030618Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d50cf8a64b89da8c5e0a6a1424e71342a023ed8f478adefa5bac8ee27903808f","observation_id":"c8b21251-6035-4794-b409-1b41bf81643a","resolution":{"observed_at":"2026-08-07T13:16:17.095540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.857080Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":"575780dc-2e6a-4859-ab11-c5a4b4ec009c","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.149839Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:f2be40e09e2760c98a4dfb8be15f0a3f2dc628a2a411ea140808c83b83c8f977","observation_id":"5f93167a-8333-4b84-9aa6-02e28e1791d0","resolution":{"observed_at":"2026-08-07T13:16:16.938047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:16:00.249033Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.249033Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:5ff32465835e6186add5b72666f6a4d4933d1f9032b25027af5d6c1d687713c6","observation_id":"b1048332-956b-40ae-97f3-948b0f060334","resolution":{"observed_at":"2026-08-07T13:16:00.249033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.328567Z","title":"Kleijn and A.W","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.328567Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:73fba745008de1ab2c0fec4be0301214aecc81ea906d340209500844f570df0f","observation_id":"07d239ca-ddc3-4b44-bd0a-7fa83874c750","resolution":{"observed_at":"2026-08-07T13:16:00.328567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/biomet/83.2.299","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"On asymptotic properties of predictive distributions.Biometrika, 83(2):299–313, 06 1996","venue":"Biometrika","work_id":"dbeeb08e-9eee-4d3d-9e82-3bfcf4cc834c","year":1996},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.414859Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:c705cb6b013b0952db33bb749353c6ef28046af296023af24a07e875c49a98fa","observation_id":"60336ccb-c3d8-410e-b70c-1f30de21c1e6","resolution":{"observed_at":"2026-08-07T13:16:05.898060Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T13:16:00.532185Z","title":"Offline reinforcement learning with implicit q- learning.CoRR, abs/2110.06169, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.532185Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:56b3836ed035526f096d98670c6a68474ac9954c59ebda8964d89bb91cfb9537","observation_id":"5a7d85c1-7902-4a0e-b581-c368ca353447","resolution":{"observed_at":"2026-08-07T13:16:00.532185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.647572Z","title":null,"venue":null,"work_id":"70246450-43f5-4544-a229-4d9c6241d9cf","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.631981Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:41a32e2164ab958d5f33aebf9b3aa34478c62339be0be244f039a9a799ba0284","observation_id":"30ecba1b-69b7-4d9b-858a-2f4e7484e894","resolution":{"observed_at":"2026-08-07T13:16:16.756648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.476937Z","title":"Conserva- tive q-learning for offline reinforcement learning","venue":null,"work_id":"720aed21-bde5-4c1a-8408-1edf9b54eef7","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.720547Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:2787a568a03e0a260d3edfa581012a9582b61163c5663396e4d363f62b17303d","observation_id":"ffe6b090-67c1-4b10-80c7-98f457a65e28","resolution":{"observed_at":"2026-08-07T13:16:16.535991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-642-27645-3_2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":"Springer Berlin Heidelberg, Berlin, Heidelberg, 2012","venue":"Adaptation, learning, and optimization","work_id":"79333aa0-ec6b-466c-afb9-bab560fe5987","year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.803761Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:b1dce9fe47e7df3016b905e1bf0bcfad1a930090adfffbaa56fc3e20088e08a5","observation_id":"ca65e117-c96a-4482-946a-1488ab71b6ce","resolution":{"observed_at":"2026-08-07T13:16:05.713211Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.283113Z","title":"On some asymptotic properties of maximum likelihood estimates and related bayes’ estimates","venue":null,"work_id":"1e73eeb4-d8bb-4964-925b-ec604aac9a1f","year":1953},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:00.913603Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:adc4ac32b44eef1b30db99ff4ba0646d9a2bac31dac5d1e61a716cad27b5b2a8","observation_id":"59003146-ce29-4e1a-b6de-9a5eeb746557","resolution":{"observed_at":"2026-08-07T13:16:16.367331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.094506Z","title":"Efficient backprop","venue":null,"work_id":"31bb36b9-919a-4ca4-9ac7-415669b558d2","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.009737Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:cbbe30bb277318d7f5df1f97215df08082d04df989eb73095ba6aaf67d34116c","observation_id":"c3b51491-c4f4-492e-853b-98679cf6c568","resolution":{"observed_at":"2026-08-07T13:16:16.174298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:16:01.099532Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.099532Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9008974c7fcf24b619c04c038ac0953b7dd445a7e0578caa50299c5a70f5271a","observation_id":"f588b94a-fc8f-49ea-8df6-56381841e2ab","resolution":{"observed_at":"2026-08-07T13:16:01.099532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.913706Z","title":null,"venue":null,"work_id":"30505215-061b-470a-9fa4-96dae83b1c30","year":1980},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.205003Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:4b5c98d8deb9099a3d6ea9093c1ef53093f7f46c1ce9fd03eeccf3052d905405","observation_id":"763cabbd-dca8-4f36-9bd2-80503a8a572c","resolution":{"observed_at":"2026-08-07T13:16:15.993087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.812492Z","title":"Discovered policy optimisation.Advances in Neural Information Processing Systems, 35:16455–16468, 2022","venue":null,"work_id":"fd334c5f-8447-462b-8276-b5015c5e4911","year":2022},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.369676Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:1c10f0303b40c5b82f90dd5593f4d12aa3835de3cbdd1b53731871f058ad1dc8","observation_id":"7f2bc730-51c6-4fd0-bd3b-dfa8cec553e6","resolution":{"observed_at":"2026-08-07T13:16:15.846851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.679801Z","title":null,"venue":null,"work_id":"d6366746-fc02-43d7-b262-8ed970d150ca","year":2022},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.541553Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:5bce78278fee6b7551ba1f031f8a0e7db6de4d86e149db49c85d3776d41ddef9","observation_id":"c8edee02-d5e4-4aca-8ff9-e8d4973c8c16","resolution":{"observed_at":"2026-08-07T13:16:15.734238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.476993Z","title":null,"venue":null,"work_id":"a492b231-5438-4b82-a493-667556fbb8f6","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.622269Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:9e8a5e6e65508105543e47b25dbf57ecacda2fde19a2e186ccf7df4a92a561d1","observation_id":"0efa23b4-2053-4f0e-bc2e-4046f7604aa4","resolution":{"observed_at":"2026-08-07T13:16:15.552146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.713071Z","title":"Reinforcement learning: An overview, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.713071Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a5da0fc3d7334a6edb3701670999662dae3f9f5651d796a50e1666de290895de","observation_id":"109b40e2-9355-43a8-919c-180a8a979deb","resolution":{"observed_at":"2026-08-07T13:16:01.713071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.154634Z","title":null,"venue":null,"work_id":"59b90bb9-94e7-4786-a7b0-fee36c621515","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.806401Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:70b8fee0cb76ac66071ab4e4b704b639cf8651ac3c873cd5e45f33fbcaa45393","observation_id":"faa5c574-0182-4877-94e7-37959d84b22d","resolution":{"observed_at":"2026-08-07T13:16:15.280859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.920341Z","title":"Randomized prior functions for deep reinforcement learning","venue":null,"work_id":"cf7c7d09-de1b-467b-9b3f-fa6e5d29c4ee","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:01.878513Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:56ae504ee40c0c9db5cbd40a882255d3e2d211003323c495ac904a76a496a80f","observation_id":"5ad12ac9-c509-4e25-b824-4f25a4667b3f","resolution":{"observed_at":"2026-08-07T13:16:15.019714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09055","last_updated":"2020-07-17T15:30:38Z","snapshot_observed_at":"2026-08-13T19:09:17.216654Z","submitted_at":"2020-07-17T15:30:38Z","title":"Hyperparameter Selection for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.09055","snapshot_observed_at":"2026-08-07T13:16:02.204750Z","title":"Hyperparameter selection for offline reinforcement learning.CoRR, abs/2007.09055, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.204750Z"},"links":{"cited_paper":"/paper/2007.09055","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:cd3780d242e11656769d599468035b1c0e68f5f3638527f833a8b23643161bb6","observation_id":"3f69e0b2-8fea-4d05-92fa-65b796d5717b","resolution":{"observed_at":"2026-08-07T13:16:02.204750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.380815Z","title":null,"venue":null,"work_id":"9071b8a3-d90d-4e0a-9fe1-8c9e6a0ea02e","year":2012},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.297041Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:f18d05f52f888b4d1764cfcb7860bce25fc94a11d2f83a9959d1bbfabb48b3de","observation_id":"3cdb724d-205c-4577-bfcf-229b3a585e22","resolution":{"observed_at":"2026-08-07T13:16:14.501296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.136991Z","title":"Puterman.Markov Decision Processes: Discrete Stochastic Dynamic Programming","venue":null,"work_id":"a7c18587-c0f8-4184-a712-39cac5a791bb","year":1994},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.466920Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:56e16ca140d71f4ff6419e8887c5c43ebf75a050798cea0ff627852395ed864c","observation_id":"01135a97-f1f5-4186-8595-cbb430cf666a","resolution":{"observed_at":"2026-08-07T13:16:14.254455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.864099Z","title":null,"venue":null,"work_id":"d4916bba-70ba-46b3-88ff-913ca5c4d0c6","year":2006},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.570369Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:21beacc654f339071fc80cf207e23ea2d42035d8243844c4bc36496b1f043306","observation_id":"d3db7484-5096-47a1-8f1d-99d7ad8a2b2e","resolution":{"observed_at":"2026-08-07T13:16:13.976552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:02.646018Z","title":"Roberts and Jeffrey S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.646018Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:2bcfbfa1ec99541ef4daa7a01019f65bd723deddf65f8a72ed97f6ddcba14007","observation_id":"a6c1a408-8b9c-43d6-aae5-a7adf262494e","resolution":{"observed_at":"2026-08-07T13:16:02.646018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:16:02.763290Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.763290Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:44bb356032d12c4555f42b3aa1be0c93cb3ce30cf0d01ac99bea0e670259115e","observation_id":"6548a700-b2b2-4587-8ecf-bf30c365eb12","resolution":{"observed_at":"2026-08-07T13:16:02.763290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.603728Z","title":"The edge-of-reach problem in offline model-based reinforcement learning","venue":null,"work_id":"91c8e017-a436-4702-825d-5eff6bca8223","year":2024},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.940355Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ff44402b03fef0398d43318702016c1951abeede1995859489334dd704e74d8f","observation_id":"c9630eac-592d-458e-962e-7de77b2b2c11","resolution":{"observed_at":"2026-08-07T13:16:13.702817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.360716Z","title":"Smallwood and Edward J","venue":null,"work_id":"99b017a4-eba1-4043-b581-eb60035afaba","year":1973},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.098532Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:f00431ba3cf5da38a2e1513450156d3a42b47941845d4e317e3d9ceb13f967ca","observation_id":"a4892ae3-3add-4651-956c-4ebe72a9e2f7","resolution":{"observed_at":"2026-08-07T13:16:13.474924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02788","last_updated":"2023-02-06T14:03:33Z","snapshot_observed_at":"2026-08-13T12:50:12.449206Z","submitted_at":"2023-02-06T14:03:33Z","title":"A Strong Baseline for Batch Imitation Learning","version":1},"cited_work":{"arxiv_id":"2302.02788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.02788","snapshot_observed_at":"2026-08-07T13:16:07.095903Z","title":"A Strong Baseline for Batch Imitation Learning","venue":"cs.LG","work_id":"1d048c0b-d647-45c7-893c-8538dd7c3e00","year":2023},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.231306Z"},"links":{"cited_paper":"/paper/2302.02788","citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:aa4e53a8a579b5bb6bb82dfefae3eb7278726b34a9a9703a9e972ecb72a257e2","observation_id":"3dbaf9de-ba74-42ea-a427-5573b308c687","resolution":{"observed_at":"2026-08-07T13:16:07.261939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.156502Z","title":"Sriperumbudur, Kenji Fukumizu, Arthur Gretton, Bernhard Scholkopf, and Gert R","venue":null,"work_id":"d8887514-443a-4f5c-9526-4de7a57a7326","year":2009},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.346225Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:17f087d2036a95127a553142fabcee346478a118d4ad9b938bfdc121f80f38cd","observation_id":"47b7cc56-f8b3-4513-a944-01b1baf5d6da","resolution":{"observed_at":"2026-08-07T13:16:13.245354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.988121Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning","venue":null,"work_id":"51d05278-4be0-46e1-a5be-7c4e64a94a69","year":2023},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.495666Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:42192e468a3664e837e4d9264ab70ff836768926d502f6b90291cfddd57d95b2","observation_id":"9d4ce3f3-a4e3-43ae-9e00-b4997b3e5697","resolution":{"observed_at":"2026-08-07T13:16:13.080447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.754496Z","title":"Sutton and Andrew G","venue":null,"work_id":"eeba071f-6ba6-493d-b660-639e3ccc0a3d","year":2018},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.611536Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:2d31bfb92079e7e3bf0b380cee5eb25aeeccad979d04d3e880f0468fcc4ec29e","observation_id":"6f3323e5-478d-4efc-99b4-5fca93c0204d","resolution":{"observed_at":"2026-08-07T13:16:12.860042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2200/s00268ed1v01y201005aim009","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:05.475713Z","title":"Algorithms for Reinforcement Learning.Synthesis Lectures on Artificial Intelligence and Machine Learning, 4(1):1–103, 2010","venue":null,"work_id":"2d52417c-7971-4839-afa0-bf87ff7e169c","year":2010},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.712384Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:cb4d131e20ac3095239c60e01458fa7e8101ffdc295c74039b0fcedc5a2b9eb3","observation_id":"00410bc4-e85a-44a8-81b3-59f65070875b","resolution":{"observed_at":"2026-08-07T13:16:05.532252Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.572146Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":"bb91b20b-0fa8-47b1-9c3e-be875c16aa28","year":2023},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.845273Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:8d4794d03cea95941b2cd3b335689183dfa852ea14f641a98d1bdb445cf1adb3","observation_id":"148591fc-2b94-4a6b-95e3-f4149d0dd418","resolution":{"observed_at":"2026-08-07T13:16:12.677528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:12.267721Z","title":null,"venue":null,"work_id":"04ebbe5e-a2bb-4a12-985f-2aa999fd4f32","year":1986},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:03.993853Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:80c1b1fd64e7c68852204f0351ff2ae02694a5e6e0313459a87eb7afd34d13b7","observation_id":"3f1d74b1-20f4-4f2d-b848-9d4d2ddcc294","resolution":{"observed_at":"2026-08-07T13:16:12.382724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:11.966271Z","title":"Kass, and Joseph B","venue":null,"work_id":"0e91098f-e524-4acd-b943-2f4a0d40cde3","year":1989},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.077806Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:bf9045ce8d7d69f8be79873c1a8cc1f96a2fb0f9b66dbf90f3d894f1f6263852","observation_id":"2c8874e2-5f69-48de-8f6f-a726461790cb","resolution":{"observed_at":"2026-08-07T13:16:12.102869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/cbo9780511802256.011","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"d397448e-3cac-47bc-a723-787d346d1269","year":1998},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.164651Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:348ab4978247ff7c79a34c25671b07de9ff65dfbc894a7041752dc585849b1ec","observation_id":"52eacba7-dd3b-435e-9019-4de3411263b5","resolution":{"observed_at":"2026-08-07T13:16:05.370696Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:11.554238Z","title":"Information rates of nonparametric gaussian process methods.J","venue":null,"work_id":"40101a6c-a184-4de3-ba6f-dc56c2a5c45e","year":2011},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.247779Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:c759e50f08e4542683416f5d34053d26bb73fff9eea0e703c35f623d9c7936af","observation_id":"200ba08e-31ef-46ab-9499-8a18109ff2ee","resolution":{"observed_at":"2026-08-07T13:16:11.719273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:11.087066Z","title":"No more pesky hyperparameters: Offline hyperparameter tuning for RL.Transactions on Machine Learning Research, 2022","venue":null,"work_id":"1a6e58ff-d04a-483a-b8b4-9b20ac714cb9","year":2022},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.382384Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:5b90de3bea26610164500a4e75f68db6bf6f6da52409435eb12d2ba23efafd31","observation_id":"a5ff4e8f-5141-4868-a201-40cd77bbf3f9","resolution":{"observed_at":"2026-08-07T13:16:11.312056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:10.751079Z","title":"Foster, and Sham M","venue":null,"work_id":"df4d8111-8f84-45a5-b43b-3a2723ce571a","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.503412Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:06b9644a8724169613a9bd54223a8618492ac40beeafd56824be7074c764e5ef","observation_id":"6db256f6-ee66-49ff-94bc-74333915930d","resolution":{"observed_at":"2026-08-07T13:16:10.928204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:04.598127Z","title":"Differential-space.Journal of Mathematics and Physics, 2(1-4):131–174, 1923","venue":null,"work_id":null,"year":1923},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.598127Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:038f4df0770d67db10043f67e5c28e1e58777776c26aa6eee8ded224ca4fa2fa","observation_id":"377f2112-f27e-47e5-b138-44b928cd80b0","resolution":{"observed_at":"2026-08-07T13:16:04.598127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:04.682823Z","title":"Information-theoretic determination of minimax rates of convergence.The Annals of Statistics, 27(5):1564 – 1599, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.682823Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:09c2d84169d8e2b6181f9eadfe54da4086424edec7fae97075f073a49a665236","observation_id":"d1f9866b-e8e5-4644-b4b1-5d10a190d644","resolution":{"observed_at":"2026-08-07T13:16:04.682823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:10.432078Z","title":"Mopo: Model-based offline policy optimization","venue":null,"work_id":"6f221632-5c37-4c00-aec8-20b4b1c81ee4","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.761857Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:aba9fb832ff61138841405c389770c606363000c334a041b111a70fd40077626","observation_id":"32d5bb05-0908-42bb-9fad-fc95a8b99a71","resolution":{"observed_at":"2026-08-07T13:16:10.584652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:10.126288Z","title":"Combo: Conservative offline model-based policy optimization","venue":null,"work_id":"29d6ce2f-43e7-4792-8021-9adcf6efa435","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.859926Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:e1a9cf7270c03db9eeb1856887a2e6ac6abf67717867845c63cbd51fd946289e","observation_id":"c848b3c1-b773-4246-9597-50e98808cd6f","resolution":{"observed_at":"2026-08-07T13:16:10.295053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:09.857121Z","title":"On the importance of hyperparameter optimization for model-based reinforcement learning","venue":null,"work_id":"e0d323e8-7ed1-4e27-ae5a-ecf63566cbb7","year":2021},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:04.932417Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:ea18bb06de04c321fa254e0f6eac297b2d2f4008b29fbc1ddd7511732092d376","observation_id":"d95966f2-0215-4863-a16c-934f6f31a520","resolution":{"observed_at":"2026-08-07T13:16:09.953911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:09.611955Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta- learning","venue":null,"work_id":"ead35739-d696-4adf-a1e8-8e11ebf8e03f","year":2020},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:05.017057Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d471ff9098b25fa1423c19183c3d56c0baecb7aea85e1c6dd9cde6570f0f0f8a","observation_id":"01f6eb3b-010c-4d61-ab64-ee67d6026ba2","resolution":{"observed_at":"2026-08-07T13:16:09.714445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"files/5323668","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:06.793023Z","title":"N−1X i=0 1 N D 2 log(2π) + 1 2 D−1X d=0 logσ 2 θd (xi) + (yid −µ θd (xi))2 σ2 θd (xi) !!# , =Ei∼UN","venue":null,"work_id":"795cfc02-6d1d-45dc-bdfa-0acd94ac1881","year":1965},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:05.082852Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:858357c3ae45e192a503df450676541068a9cad5b7c43f89ffaee51b2172fcf2","observation_id":"e4a4b1c3-7783-4bf3-86a2-7dba28d76125","resolution":{"observed_at":"2026-08-07T13:16:06.856195Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3970.0700","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:06.532305Z","title":"Eθ∼PΘ(DN )","venue":null,"work_id":"eb4ccb72-791c-454f-82f8-9a5bbf508f38","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:05.159203Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:0bc769bdbc0e56172a6bb8dfb60c354870574bebd5a8ed199b99c0a530140537","observation_id":"584f4e18-5a1d-4826-9888-eb69dfcfea54","resolution":{"observed_at":"2026-08-07T13:16:06.605584Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.660083Z","title":"doi: 10.1093/oso/9780198504856.003.0002","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.660083Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d0ae240a5a30fc85e968398034db41d2680701dd882c796e4902a0e1371291e2","observation_id":"d995e4c3-886c-44f7-9c7a-9ca3fbf81918","resolution":{"observed_at":"2026-08-07T13:15:57.660083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.534970Z","title":"URL https://books.google.co.uk/books?id= s6mVlgEACAAJ","venue":null,"work_id":"0840bc97-8866-4430-b4b4-1d6bc116f8d1","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:57.884088Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:82ee9993fa61a23e12b3a886aeefe6bb0559a52d7ab2da0003c0dceb07174bde","observation_id":"aa4e3f11-d59b-4bd4-a552-fd3592fb27fd","resolution":{"observed_at":"2026-08-07T13:16:20.621497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.526852Z","title":null,"venue":null,"work_id":"6e5ee6d1-f0b2-41a7-9eb6-b48881bcfcc4","year":null},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:59.744897Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:a1aa7160268b5ccd50f23aaed82d080c554750bda9a8efa913014bda0d097d73","observation_id":"1e434d6f-04c0-42fb-b1dc-edaa8c4dbd63","resolution":{"observed_at":"2026-08-07T13:16:17.599212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.613646Z","title":"URL http://papers.nips.cc/paper/8080- randomized-prior-functions-for-deep-reinforcement-learning.pdf","venue":null,"work_id":"9099fa13-f193-42ef-be0b-e1afb00421a0","year":2018},"citing_paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning","version":3},"reference_index":8629,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:02.029997Z"},"links":{"citing_paper":"/paper/2505.22442"},"observation_digest":"sha256:d3883e036d14955d4811a9ed84db6c72b3fe8a64924b5e8e9ef6693c230112ea","observation_id":"8c85133c-fff4-4179-b7a6-273632e7103f","resolution":{"observed_at":"2026-08-07T13:16:14.762978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22442","last_updated":"2026-07-15T19:14:08Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T13:27:05.315034Z","submitted_at":"2025-05-28T15:07:24Z","title":"Fully Offline Reinforcement Learning"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":11,"verified_fuzzy":41},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 2 inbound Pith citation observations for arXiv:2505.22442."}