{"as_of":"2026-08-13T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a911da9cadf2dcb0db1f36c7aff753a529dbda4efc1e1f618086a820520a6fdf","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:30:49.187659Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18855/citation-record","integrity":"/paper/2412.18855/integrity","json":"/paper/2412.18855/citation-record.json","paper":"/paper/2412.18855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.935676Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.935676Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:9a16b979fe6c5204987d1c4ab68d932d064ad2739f0f5fa9b62c6afddb7bfde7","observation_id":"3be00b87-80c9-4e0d-83fb-77693bf1b357","resolution":{"observed_at":"2026-08-11T04:30:48.935676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:50.082287Z","title":"Reinforcement learning: Theory and algorithms","venue":null,"work_id":"a83d4d56-1b10-4ca8-8301-60aab3b0f8cb","year":2019},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.941106Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a195b165728033cee8ab130188a30479810466a200d546b69c262a36cd3c0989","observation_id":"b8e8779d-b6d3-40c8-8977-23a777fb2748","resolution":{"observed_at":"2026-08-11T04:30:50.087909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:50.066830Z","title":"Reincarnating reinforcement learning: Reusing prior computation to accelerate progress","venue":null,"work_id":"9409c118-6a69-4d9a-ba84-d7090f1850eb","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.946054Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:d6a26122715214daa51db454a926368c3843731a1fb156b9c0ef8564e9f51570","observation_id":"c1eb6107-27ea-47da-b206-13c9cf8efe86","resolution":{"observed_at":"2026-08-11T04:30:50.071758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-08-13T12:50:02.161212Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-11T04:30:48.950682Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.950682Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:8ad7882ea2c86f32de98125f91ab2568e185b13bd635b328d6d8ea315fe289a9","observation_id":"aeba181c-5585-4ce2-88a1-953ce5a8e638","resolution":{"observed_at":"2026-08-11T04:30:48.950682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11802","last_updated":"2022-11-21T19:10:27Z","snapshot_observed_at":"2026-08-13T13:37:57.582982Z","submitted_at":"2022-11-21T19:10:27Z","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11802","snapshot_observed_at":"2026-08-11T04:30:48.955499Z","title":"Improving td3-bc: Relaxed policy constraint for offline learning and stable online fine-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.955499Z"},"links":{"cited_paper":"/paper/2211.11802","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:671a3aebc24f49ecf9e041cd0420da1ef4af6dff6502285d57f25168e419dee0","observation_id":"f57d225d-8fdb-48d5-9a7b-b1e140eff677","resolution":{"observed_at":"2026-08-11T04:30:48.955499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.960378Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.960378Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6283a7d6ead359e9ef8fa46202eecb48398d5d8967226ab97d59499c8d1cb55c","observation_id":"931c0e32-c4c3-48b9-a8da-f1bc7699846c","resolution":{"observed_at":"2026-08-11T04:30:48.960378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-11T04:30:48.965286Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.965286Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:038961e291f1b9d4e987448022ca287c841ec552a5acb831234aae46742f58a0","observation_id":"8d97be98-45b7-48a3-8e26-6d41cd6f76c7","resolution":{"observed_at":"2026-08-11T04:30:48.965286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:50.042176Z","title":"Uncertainty-aware model-based offline reinforcement learning for automated driving","venue":null,"work_id":"7833446f-4f4e-4cab-81cf-63aee31d5164","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.969948Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:53c29a19108e6880edbbd813ecfa3cfdce440234bf56a5850b58526211bf39e9","observation_id":"16a0bb77-79d9-41f5-bf6e-e2a850b4f462","resolution":{"observed_at":"2026-08-11T04:30:50.047352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-11T04:30:48.974180Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.974180Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:cbf3475dc072688ed7107ec3547d9994fe88bc4bc7d77e5702556835cb47a193","observation_id":"1be9be94-cf64-49a2-a916-7783e452b959","resolution":{"observed_at":"2026-08-11T04:30:48.974180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.978973Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.978973Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:df8989336a13f3a6ff9815e07b12f6993d40426c07bcfc9ee41c621afa4f6e80","observation_id":"3b822ef4-6f86-4a48-95c5-9a5f7ddfd70f","resolution":{"observed_at":"2026-08-11T04:30:48.978973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.983533Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.983533Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:3c8fcdcd64bb35041f71131eada082466117449ede5267202c57239b011ed982","observation_id":"26167c32-88bf-4702-b62e-2c88e1012874","resolution":{"observed_at":"2026-08-11T04:30:48.983533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:48.987827Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.987827Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b43002d58c518fa207f040ae42e47913c3dcde94e268c8720bbd730fa436ca36","observation_id":"3e884ace-2ae7-4635-b915-da21ba897fbc","resolution":{"observed_at":"2026-08-11T04:30:48.987827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-13T13:09:03.918851Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-11T04:30:48.991946Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.991946Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:da24d8711473287f2039a520ddba0a8b5333c85518913a608df7d4d255538f27","observation_id":"94ccdcad-0bf9-47a6-ab8c-1e72494dfeba","resolution":{"observed_at":"2026-08-11T04:30:48.991946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.996335Z","title":"Open and real-world human-ai coordination by heterogeneous training with communication","venue":null,"work_id":"4df46a7e-f940-4fa0-8f7f-33564d5d1637","year":2025},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:48.997192Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:7570d466075dfc121132f4c3f4b61036d0d87712fe999f4ca598c6fb18194ed8","observation_id":"1078a651-dda5-442a-99a1-292e83de04f2","resolution":{"observed_at":"2026-08-11T04:30:50.001318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.001554Z","title":"A simple unified uncertainty-guided framework for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.001554Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:d20c255a0de7e654aa2a89813492f4ecdcedc3fb916c11bf845c095edf638bcc","observation_id":"791cd18e-9715-4197-8547-41090e436c30","resolution":{"observed_at":"2026-08-11T04:30:49.001554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.005983Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.005983Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:50ad45d0f50f5c9649394b08348bf77bca136e2133c43c236c10fac83a0b4f4b","observation_id":"a2a59874-9d4a-42a2-8e17-a87128268627","resolution":{"observed_at":"2026-08-11T04:30:49.005983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.010070Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.010070Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:9c5fc83c90340b6bbf2d5d8b9d34739e0288c8918840b38ac177f42696e6757d","observation_id":"680d33f4-22a6-4f31-8ff5-940f5489d238","resolution":{"observed_at":"2026-08-11T04:30:49.010070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-11T04:30:49.014463Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.014463Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:f71b7553ff7356ec750844a6e47e83fb9a931536d8c64144231c69677678e634","observation_id":"f919f741-e582-43b1-9b2d-b1242342896c","resolution":{"observed_at":"2026-08-11T04:30:49.014463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.964550Z","title":"Uncertainty-driven pessimistic q-ensemble for offline-to- online reinforcement learning","venue":null,"work_id":"a5ff878e-9fdf-43c6-aaac-4c7006536eb1","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.019462Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:0a354f0b0811cd55a0e5453c8223caf4fe62f600c548b4a8c16cc12d8a421eb4","observation_id":"516b2635-e169-418f-987d-e79741e2376e","resolution":{"observed_at":"2026-08-11T04:30:49.969216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.023652Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.023652Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:95b60d185a52cf10261b4e1728b35cb532160416a6cb2dbf0649a786b0a6d9b0","observation_id":"64af4ca2-64c0-40f6-9c16-df69ed7322cc","resolution":{"observed_at":"2026-08-11T04:30:49.023652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.027727Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.027727Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:33f5f58ca440c56fcb6e6273fa373310f2ff48b51369b2eb176caa89ac47f3ae","observation_id":"6746a8bb-fd32-4958-a3e1-2deb673aa3ab","resolution":{"observed_at":"2026-08-11T04:30:49.027727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.930322Z","title":"Batch policy learning under constraints","venue":null,"work_id":"a615919a-8ae7-44a9-bf4e-07f0e9b5e9ef","year":2019},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.031806Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6832fa49fc546fdba8a9023f589b4bef26dce90ce790638c56bc8966d0666834","observation_id":"17fb3d7f-9744-436b-8fe3-685d92aaf3ba","resolution":{"observed_at":"2026-08-11T04:30:49.935505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.914178Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":"1b40cd2e-4300-4059-9415-c486dd0d51df","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.035910Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:e72103d976c13aafea4c88c22c3d8317a770c0ccb803b5edad00681bcf30c9fa","observation_id":"c00cb2d8-d4c6-46e5-b035-6c9dc9e02144","resolution":{"observed_at":"2026-08-11T04:30:49.919106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03351","last_updated":"2024-03-17T04:40:06Z","snapshot_observed_at":"2026-08-13T05:31:53.479535Z","submitted_at":"2023-11-06T18:58:59Z","title":"Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03351","snapshot_observed_at":"2026-08-11T04:30:49.039985Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.039985Z"},"links":{"cited_paper":"/paper/2311.03351","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:0deea8a67c176669e9f2444a01df1f6ca079227516c2c932dea6157159da7245","observation_id":"391ffc41-f4b9-468d-a5cc-564f956456eb","resolution":{"observed_at":"2026-08-11T04:30:49.039985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-13T11:33:55.184747Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-11T04:30:49.044417Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.044417Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:e3b1d2b9c3b64ac8d05fd6c039ffc71b19ce81c92317d816b80eaa3acff97f4e","observation_id":"7b857664-28ff-4841-a166-1eed0a315c88","resolution":{"observed_at":"2026-08-11T04:30:49.044417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-08-13T12:13:14.458707Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-08-11T04:30:49.048977Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.048977Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:23ee15b61dfeb9b9344aa9bb40b255720a338cc43d7f18e2dc63d23e843d8bef","observation_id":"82fd9920-06d9-4eac-9227-6fc5976b813a","resolution":{"observed_at":"2026-08-11T04:30:49.048977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.898544Z","title":"Mildly conservative q-learning for offline reinforcement learning","venue":null,"work_id":"8e662387-bef3-4824-813f-52eb5c48d97e","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.053729Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:3133b2dd721011f4b592df57c7874157db1da0f24adf0a8ca820a3a5f763a615","observation_id":"53a18ba4-5f14-4d3c-8f35-9dd8a1d5391c","resolution":{"observed_at":"2026-08-11T04:30:49.903853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10070","last_updated":"2022-01-25T03:14:57Z","snapshot_observed_at":"2026-08-13T16:53:51.827534Z","submitted_at":"2022-01-25T03:14:57Z","title":"MOORe: Model-based Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2201.10070","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10070","snapshot_observed_at":"2026-08-11T04:30:49.406876Z","title":"MOORe: Model-based Offline-to-Online Reinforcement Learning","venue":"cs.LG","work_id":"49f7d3ac-f43d-4376-878e-8a6f608a3c45","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.057905Z"},"links":{"cited_paper":"/paper/2201.10070","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:cfcdd05f3ba62bc966197c7012c7b005d6298aae014c2d7e3d39f35e80f269a6","observation_id":"9dfaeb79-4d21-4164-9f6e-3c6368a1aa84","resolution":{"observed_at":"2026-08-11T04:30:49.411742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.882601Z","title":"Supported trust region optimization for offline reinforcement learning","venue":null,"work_id":"3ba8f27e-ad50-40c4-a5d9-de904d01e6ed","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.062641Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:442382bb595e10cd04c130cb5377ea688ce05dd6760b3a06b12553a806d545a4","observation_id":"fbd3e492-d978-437d-938e-9749de752dea","resolution":{"observed_at":"2026-08-11T04:30:49.887854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.868160Z","title":"Fine-tuning offline policies with optimistic action selection","venue":null,"work_id":"d8a3ed26-0418-4c0c-bfb2-b0979bb235db","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.066875Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:2d89df423dfb5d7de011a79acae64115ccc3e1d3622a3e851b0476e5cd4b8dda","observation_id":"1281f0c8-a005-4ff5-b632-a1173f4816a4","resolution":{"observed_at":"2026-08-11T04:30:49.872845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05723","last_updated":"2024-06-21T13:13:15Z","snapshot_observed_at":"2026-08-13T10:46:18.333394Z","submitted_at":"2023-10-09T13:47:05Z","title":"Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2310.05723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05723","snapshot_observed_at":"2026-08-11T04:30:49.385747Z","title":"Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning","venue":"cs.LG","work_id":"daa98473-1124-4e3f-bc53-39d8f560d131","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.071160Z"},"links":{"cited_paper":"/paper/2310.05723","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:be363898848e169160013da5a17eb35826136d1f5fa82c2ef90bb1b43f8f216f","observation_id":"5d037d44-40f3-4ef0-96c3-9441caeb1c8b","resolution":{"observed_at":"2026-08-11T04:30:49.391005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-11T04:30:49.075601Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.075601Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:366cd5dc5c7ba825d25787da88dfa3f28a91a31d284a608cc9cfaceba7523ee3","observation_id":"87cd898a-545a-4798-8d34-cfe6b3d63c7c","resolution":{"observed_at":"2026-08-11T04:30:49.075601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05479","last_updated":"2024-01-20T03:51:39Z","snapshot_observed_at":"2026-08-13T12:28:08.731404Z","submitted_at":"2023-03-09T18:31:13Z","title":"Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05479","snapshot_observed_at":"2026-08-11T04:30:49.080017Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.080017Z"},"links":{"cited_paper":"/paper/2303.05479","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b2d37ab4ac1f6bcec9608a178f5569eaa854c629199416ec2bc47ff06427de15","observation_id":"2e2f4430-3cb6-4f79-ba2e-f0e4e1694785","resolution":{"observed_at":"2026-08-11T04:30:49.080017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.853656Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism","venue":null,"work_id":"61527d34-d868-4f21-a41a-113fe1eee8ef","year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.084656Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:f0ed14fce08f9b88c2274c7ae144aa214012f58764460598ae83253407ad1d14","observation_id":"77df57cc-3353-487f-a5cf-429697734043","resolution":{"observed_at":"2026-08-11T04:30:49.858375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.089965Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.089965Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:49cb338ed977403564caa39672fe8aa1e63b78c791a171163cf49cbe2ebe91e0","observation_id":"16c7240c-2801-434c-9ca7-525d0eecf8fa","resolution":{"observed_at":"2026-08-11T04:30:49.089965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-11T04:30:49.094279Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.094279Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b9212267f23119f6dede4cf8321a70b0c69f7cf29be3dc3efbe48926e53433b3","observation_id":"3f1115b8-aee4-4409-a4d4-0693a3fdc85d","resolution":{"observed_at":"2026-08-11T04:30:49.094279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T04:30:49.098890Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.098890Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:898f396c66c1ba29310791fa25f16ad54402e8fe73fada41a91a6ace792246c6","observation_id":"3b2e1149-fdc4-4d38-8b3e-976e37b5566f","resolution":{"observed_at":"2026-08-11T04:30:49.098890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.826147Z","title":"Sutton and AndrewG","venue":null,"work_id":"62e0e3c0-24a0-470b-84bd-65d3c32ea869","year":2005},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.103172Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6e682e5b6c0ea1f039cab10fa67c90a2a4d30d43ef1b96f8e271e34dded60001","observation_id":"88530470-1a24-44bc-9604-bad92fa4e204","resolution":{"observed_at":"2026-08-11T04:30:49.831044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.810970Z","title":"Lever- aging factored action spaces for efficient offline reinforcement learning in healthcare","venue":null,"work_id":"b3d8c86e-3763-4520-8cea-ae0cd04a9b2b","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.107419Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:877b0b5ad0af6664aeb8a64e814ed5056f042a68d110f7645711e50e78ea55a5","observation_id":"601c7bc8-c6a0-41ef-9765-2c427eebd7dc","resolution":{"observed_at":"2026-08-11T04:30:49.815625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.796584Z","title":"CORL: Research-oriented deep offline reinforcement learning library","venue":null,"work_id":"3fdc0368-aa5e-4524-ab72-e4a32d131c99","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.111884Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:f3ed63e7184bed73a79d6e153e216e88fd4b31861120265b9851490adda46eba","observation_id":"a778597d-eb97-48f1-a963-2c861bc24650","resolution":{"observed_at":"2026-08-11T04:30:49.801226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-07T08:33:38.128537Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-11T04:30:49.116005Z","title":"Reward constrained policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.116005Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:b27d1453c480231cb3d781dd4b4d6e9b5f2e277c7346be70f40df3469eb01922","observation_id":"01c0eaf4-3bea-4485-811b-50926caddbbc","resolution":{"observed_at":"2026-08-11T04:30:49.116005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.782177Z","title":"Jump-start reinforcement learning","venue":null,"work_id":"f746b4b3-668b-42f0-9647-c70065e7d34e","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.120558Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:5eb6c1d5baef3be56fce4b96a872a019d7e2f4c359226ca2b3f7878fe8fd6cfb","observation_id":"d2f83805-5139-4b0d-a893-8b0679a025e8","resolution":{"observed_at":"2026-08-11T04:30:49.786819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.768189Z","title":"Train once, get a family: State-adaptive balances for offline-to- online reinforcement learning","venue":null,"work_id":"77b0c1b1-0d52-42c7-87c4-246ea337c7d0","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.125050Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:6e4d7cfcf7546f8609419eb68deeecfac37b46cd02c87778c612850bf49bc1d2","observation_id":"d77c9109-c886-4784-b58a-52e7e42c26cf","resolution":{"observed_at":"2026-08-11T04:30:49.772852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.753566Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"294d56d3-e34b-4fc9-a90c-41efd9d70959","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.129229Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:675ffbf598240dc1b5fad1cbbb0f392cde229b3ff54c0fd874e85997110b2600","observation_id":"7cafb6e8-c05c-48d4-ba66-1963ea3253e7","resolution":{"observed_at":"2026-08-11T04:30:49.758387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.133453Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.133453Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:28e959e8df34c4c4b3c7fefb794edf34f13d2ba9090e97b62a41438841f31401","observation_id":"d7ec5233-1756-45db-b3f8-afee46f24507","resolution":{"observed_at":"2026-08-11T04:30:49.133453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.728444Z","title":"A policy-guided imitation approach for offline reinforcement learning","venue":null,"work_id":"10430595-c81d-4c70-b642-4e2b153836b8","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.137747Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:294c65c7b15776bfc831d093eb6a1747b1465c6dec598fde095b934d3c15b0d0","observation_id":"7759f3da-00c4-4d39-b472-4b77da252b4d","resolution":{"observed_at":"2026-08-11T04:30:49.733631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-13T12:15:03.518907Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-11T04:30:49.142024Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.142024Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:0dafcadcfd9b4e7a20797d06fb286d0f5607dea92f806698a924ac444ae7ab56","observation_id":"20d6d736-a044-495b-8099-7d0881f00018","resolution":{"observed_at":"2026-08-11T04:30:49.142024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.713076Z","title":"Actor-critic alignment for offline-to-online reinforcement learning","venue":null,"work_id":"53bd5208-2454-484d-88b5-66fce93d55ae","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.146683Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:a442d4ee9af59c01ae118ab75741d50fd2eadd38591d49a365369234132c552b","observation_id":"7bafb258-e4a9-481d-8b7f-b1ff5d9a276c","resolution":{"observed_at":"2026-08-11T04:30:49.717995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04411","last_updated":"2023-11-07T16:32:51Z","snapshot_observed_at":"2026-08-13T05:55:15.604399Z","submitted_at":"2023-10-06T17:57:44Z","title":"Understanding, Predicting and Better Resolving Q-Value Divergence in Offline-RL","version":2},"cited_work":{"arxiv_id":"2310.04411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04411","snapshot_observed_at":"2026-08-11T04:30:49.273788Z","title":"Understanding, Predicting and Better Resolving Q-Value Divergence in Offline-RL","venue":"cs.LG","work_id":"8f885d7b-9cee-4b97-99ee-4ab666d61f2b","year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.151220Z"},"links":{"cited_paper":"/paper/2310.04411","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:1f0b541df1ab1d5a4a1b13f38ad5718a6ac14d96d89aaffab557afd5c7233295","observation_id":"4058ab69-5d44-424e-977b-1bd44d22b625","resolution":{"observed_at":"2026-08-11T04:30:49.280625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-08-13T12:52:57.691880Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-11T04:30:49.155903Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.155903Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:e1c78626637ce8ca6e572baedb830723ece73f51d9506ce5b979e72ba5f0b825","observation_id":"f05126e9-b6dd-412d-9435-c2f8ec460bd6","resolution":{"observed_at":"2026-08-11T04:30:49.155903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06871","last_updated":"2024-07-21T14:49:35Z","snapshot_observed_at":"2026-08-13T11:19:15.107303Z","submitted_at":"2023-06-12T05:10:10Z","title":"ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06871","snapshot_observed_at":"2026-08-11T04:30:49.160669Z","title":"Ensemble-based offline-to-online reinforcement learning: From pessimistic learning to optimistic exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.160669Z"},"links":{"cited_paper":"/paper/2306.06871","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:91959dd69c2256bedc4212bdf6e2e95d6da95f2ad344b3944c88bc944b572743","observation_id":"36075a83-cc30-4203-aa73-eade42be6aea","resolution":{"observed_at":"2026-08-11T04:30:49.160669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13846","last_updated":"2022-10-25T09:08:26Z","snapshot_observed_at":"2026-08-13T13:57:38.426822Z","submitted_at":"2022-10-25T09:08:26Z","title":"Adaptive Behavior Cloning Regularization for Stable Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13846","snapshot_observed_at":"2026-08-11T04:30:49.165225Z","title":"Adaptive behav- ior cloning regularization for stable offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.165225Z"},"links":{"cited_paper":"/paper/2210.13846","citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:3d697232f94c36eda0a95b06bd7a21d5165354645961c1e7dc509794611bb51b","observation_id":"f1c5647e-6306-4562-ab2d-7b441ae543d8","resolution":{"observed_at":"2026-08-11T04:30:49.165225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.698154Z","title":"Online decision transformer","venue":null,"work_id":"0e50ac95-4bc4-4410-bba3-9b39e4a9114a","year":2022},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.170538Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:d3fc0a88afcdf090dc097827b52416899110b81a4788c7a26bde356eb8e27118","observation_id":"652d11f2-dc55-47c1-92c3-2f48f7e03ee6","resolution":{"observed_at":"2026-08-11T04:30:49.702843Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.683386Z","title":"However, our O2SAC still outperforms it with less computational cost during online fine-tuning and less requirements for offline policy","venue":null,"work_id":"7fa8e713-94e6-4fb1-ba30-6dad6c61adff","year":null},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.175429Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:8b365b8955134406d5ef2fec054493a169c4cbd3fd6f95a28a694e932d138542","observation_id":"6a610778-6fdc-45ac-94b5-8d919abe8ac1","resolution":{"observed_at":"2026-08-11T04:30:49.688112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.668254Z","title":"For model-based O2O RL, [31] explores regions with high uncertainty and returns in learned model","venue":null,"work_id":"8b670b91-a898-4014-afe0-ab396ff52c11","year":null},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.182233Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:ea89b4928779b651e90a28a868493acf5e8f2e376510322ebd13f2583cfe998e","observation_id":"2de3f5ca-53a8-465d-90c2-41cd7ee63c22","resolution":{"observed_at":"2026-08-11T04:30:49.673069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:30:49.653162Z","title":"Moreover, [4] find that LayerNorm is favourable for efficient online RL with offline data","venue":null,"work_id":"d57bcd6c-ff3b-4ef6-8adc-61895e11d569","year":null},"citing_paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:30:49.187659Z"},"links":{"citing_paper":"/paper/2412.18855"},"observation_digest":"sha256:cbe17d952d56649717bae238620d29a2c44bc526199e8765cb070c8140a91813","observation_id":"292accf8-fd76-46a6-88f4-c3b9448ede9b","resolution":{"observed_at":"2026-08-11T04:30:49.658434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18855","last_updated":"2024-12-25T09:52:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:36:41.843921Z","submitted_at":"2024-12-25T09:52:22Z","title":"Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2412.18855."}