{"as_of":"2026-08-09T11:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33905dc4e24e1741250f7cd67c5e59cf465fd3b64704adc4333e1392a767d6e6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:31:10.781558Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:25:45.826205Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-09T11:31:10.781558Z","title":"Efficient online reinforce- ment learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T11:21:48.166006Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.781558Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:9bbd37d4b0664aad88854ea9fec0caaf59ee437e5f04e33e540c6c50337ff2ab","observation_id":"1ddfece0-6ab0-4aea-b6bf-7c44da3370bb","resolution":{"observed_at":"2026-08-09T11:31:10.781558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-08T19:20:33.609824Z","title":"Efficient online reinforcement learn- ing fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-08-08T19:14:06.157767Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:20:33.609824Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2502.05450"},"observation_digest":"sha256:bb985774aeea58aba7c197452a550ab3bb477c3ffdd80eb4f72e54341d9f41fb","observation_id":"a2193e37-82f2-4ada-8ea5-42471c41e9db","resolution":{"observed_at":"2026-08-08T19:20:33.609824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-07T14:57:46.275862Z","title":"Imitation learning: Progress, taxonomies and challenges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.275862Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:0f9a982b5c1e544ad932ca64a6fe25ea61150bdbda938d6617652a2bc906e2bf","observation_id":"526a60c2-719a-4d3d-a26a-1709df4352be","resolution":{"observed_at":"2026-08-07T14:57:46.275862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-07T12:58:56.493723Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-09T00:14:25.317749Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:56.493723Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:090a22be770f4afb43a3fe6dda54b480c6acb7d06beb349cdf4286e6a9d032f9","observation_id":"0b282f09-1121-4413-bd59-10267b12cb72","resolution":{"observed_at":"2026-08-07T12:58:56.493723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-06T19:53:06.334933Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04452","last_updated":"2025-07-06T16:18:40Z","snapshot_observed_at":"2026-08-08T10:00:23.689092Z","submitted_at":"2025-07-06T16:18:40Z","title":"SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:06.334933Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2507.04452"},"observation_digest":"sha256:8a764a73393d953e59214061363d6296cd968230167c0a255b14feba5a475cf3","observation_id":"ba3f8c42-beed-4bc0-8510-eae4208a51e4","resolution":{"observed_at":"2026-08-06T19:53:06.334933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:23952673a84c12ca809b4758a75e91cf08af9398952017a189d280084177c04d","observation_id":"010eb31b-5ee2-44fc-adbd-f9db4dea1fe8","resolution":{"observed_at":"2026-05-19T05:22:06.470744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T13:00:10.173421Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:10.173421Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:ab2daee4720a65dc4d944f533d47aa4689e28ca8dbfe84453e5d4dde2f109776","observation_id":"960fc39a-6c78-45a9-8cd2-88d8b797036e","resolution":{"observed_at":"2026-08-04T13:00:10.173421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T11:01:35.297180Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:35.297180Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:02e86164c6e78b35538ece9b41ee6eacd76e2ba0ed1487bdf71fc0c5009a99ed","observation_id":"38c6f8fb-2a80-4507-9e75-29f66546dac2","resolution":{"observed_at":"2026-08-04T11:01:35.297180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-04T07:06:51.446369Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27048","last_updated":"2026-07-10T16:45:48Z","snapshot_observed_at":"2026-08-08T19:09:58.794738Z","submitted_at":"2025-10-30T23:33:07Z","title":"SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T07:06:51.446369Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2510.27048"},"observation_digest":"sha256:cbf35fcac6b285588603ec1b82a50afa25abe04878307af043374271846a509d","observation_id":"9e952ef1-391a-48c6-972b-c985f4848809","resolution":{"observed_at":"2026-08-04T07:06:51.446369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.12243","last_updated":"2026-05-15T22:34:49Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T17:56:29Z","title":"HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T11:48:13.368844Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.12243"},"observation_digest":"sha256:421ac65e79cc89eb7c50f324a33f0067b88c11ad5880d22b7e7eb26d54994c6e","observation_id":"80f8f9bf-10fd-4a81-ba9f-f5588dec47e3","resolution":{"observed_at":"2026-05-15T11:49:58.825253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.12243","last_updated":"2026-05-15T22:34:49Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T17:56:29Z","title":"HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T11:54:57.866685Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.12243"},"observation_digest":"sha256:b65280c2b1d988af2a1c7c1b97d4ef453c63aaa27d934cda19f7d82462f4c750","observation_id":"3f1340c9-6380-40cb-8b8e-a34b9a9ae262","resolution":{"observed_at":"2026-05-21T11:55:04.124155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:46fdb37aa87f5e1e14dfc6cb805f18143b7dc208ade66621bf1b8d104b50b7fa","observation_id":"9903d06e-5fa8-4ab2-8ab6-764ca48aae88","resolution":{"observed_at":"2026-05-15T09:49:54.444164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2603.15956","last_updated":"2026-04-20T19:05:45Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T22:12:48Z","title":"ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T09:37:02.168898Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2603.15956"},"observation_digest":"sha256:1fa44745882da701097916323cdf70a366aa92420303ad559dde05dda5ee6209","observation_id":"f3a14684-4401-4cdf-a74f-3785b27866ff","resolution":{"observed_at":"2026-05-15T09:39:55.143469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2604.08958","last_updated":"2026-06-11T05:02:53Z","snapshot_observed_at":"2026-08-01T22:02:36.657096Z","submitted_at":"2026-04-10T04:57:54Z","title":"WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:05.636131Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2604.08958"},"observation_digest":"sha256:8a9ad39e74f8b6764a673e72a4e0581a2bf2599a84929b6f56341ff2c7b2c2b4","observation_id":"b39afcf6-a0d7-482b-9729-1e050cb9cd33","resolution":{"observed_at":"2026-05-11T05:10:54.325903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2604.13966","last_updated":"2026-04-15T15:17:40Z","snapshot_observed_at":"2026-08-08T02:57:57.796032Z","submitted_at":"2026-04-15T15:17:40Z","title":"Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:55:12.531822Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2604.13966"},"observation_digest":"sha256:56001739421dec848c4d8c237746656cbf98bb03537f1b92944737fda1ce1fc8","observation_id":"2b6c922f-9247-4bcc-8025-1453d1d53ec8","resolution":{"observed_at":"2026-05-10T12:55:24.122109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:25aa2f4414d26cf591b84f40f781067146729001101806b3ec7e00cdcd81865a","observation_id":"3e7e6bcc-1572-4028-95e5-a15a9bf995d8","resolution":{"observed_at":"2026-05-09T06:10:42.426634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:763b22dd3fe05fbd9322723da9c730b76bc7153af4fd543eb2471c428d2c7f91","observation_id":"5b4de9fb-0cae-4a8d-a72f-9485efdf5270","resolution":{"observed_at":"2026-07-01T00:05:09.633737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:4d29315e8d1d7bccdd3d618420e30c29a0a7215727db65495bd3e9d50d8bd0d4","observation_id":"fdd7bff5-439e-4469-9192-caf94b27fbe2","resolution":{"observed_at":"2026-07-01T14:25:45.827910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:72f0ccd46aa84b8d717cc61f9a74e9757e51379dbe6ed49fa2b3014805cf7ffc","observation_id":"9c94a5ab-9180-4f85-b548-bbb8d6e8912d","resolution":{"observed_at":"2026-05-20T13:13:18.054667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-12T00:23:04.763773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03723","last_updated":"2026-07-04T06:11:03Z","snapshot_observed_at":"2026-08-01T06:38:23.685403Z","submitted_at":"2026-07-04T06:11:03Z","title":"OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:23:04.763773Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.03723"},"observation_digest":"sha256:7e3577e59b076ed50b51442ff740ee1fb67a12075af28ec78658a983bee51996","observation_id":"cf6d3ac2-d0b0-43a4-b0d5-d4ae7b410429","resolution":{"observed_at":"2026-07-12T00:23:04.763773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-30T11:06:24.369491Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:24.369491Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:0c2c7b4f1c7732107a13c70d6f159adcf6c6e55a69d0a430a766910c39affb75","observation_id":"ebdd9374-8d1a-4aef-bda1-94e5980ee6db","resolution":{"observed_at":"2026-07-30T11:06:24.369491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-05T04:27:43.958427Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.958427Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:3fadd9f08ee9dd76caf1e7950cd773899ad8832578540efc01b3592d480bf031","observation_id":"dce039d1-cbdd-4a12-8533-f5f4580e6e34","resolution":{"observed_at":"2026-08-05T04:27:43.958427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.07762/citation-record","integrity":"/paper/2412.07762/integrity","json":"/paper/2412.07762/citation-record.json","paper":"/paper/2412.07762"},"outbound":[],"paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2412.07762."}