{"as_of":"2026-08-09T09:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d0b069158c95f8549a156010c7bc7fb51500729b98f82d83ba3e30a8ff62ef7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:45.725844Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:50:12.306741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T14:57:45.725844Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16856","last_updated":"2025-05-22T16:14:08Z","snapshot_observed_at":"2026-08-07T14:51:50.965265Z","submitted_at":"2025-05-22T16:14:08Z","title":"Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:45.725844Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.16856"},"observation_digest":"sha256:f25392a3d2b300bb061c9e474e1228b8fde8dd4383cc0c71aae6f34551b92ab7","observation_id":"29cab017-bd44-464d-b574-9ca054a70db0","resolution":{"observed_at":"2026-08-07T14:57:45.725844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T13:45:00.439564Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:00.439564Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:74e3b40a3343a57ec82fe350414ed79c5b346581491b3920f4b179e0bf74d9f1","observation_id":"e7753a3a-af6e-4cb7-ab0c-504b6df18e02","resolution":{"observed_at":"2026-08-07T13:45:00.439564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-07T05:37:46.383535Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-09T00:13:18.509711Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:46.383535Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2506.07505"},"observation_digest":"sha256:6a46e792c7a72972de9118c7033e3b26ea3b6a3cb49ba0d8128ed42eeb17c1b6","observation_id":"0b408ba0-19b1-410c-bd43-e0e121d4bbbf","resolution":{"observed_at":"2026-08-07T05:37:46.383535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:d2655c79e987f818b4c0736dec139a61ca4d5b6eb7ea227b7a9cb87fd5d66055","observation_id":"3e703aba-876f-44e6-abea-a1f2da435afd","resolution":{"observed_at":"2026-05-19T05:12:05.259804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-06T18:27:02.465774Z","title":"A., Krishna- murthy, A., and Sun, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08387","last_updated":"2025-07-11T08:00:12Z","snapshot_observed_at":"2026-08-06T18:17:30.456700Z","submitted_at":"2025-07-11T08:00:12Z","title":"Online Pre-Training for Offline-to-Online Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:02.465774Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2507.08387"},"observation_digest":"sha256:1c7b67d21e87bc382cc5f15bdf91cb5496979d72313171b117556032dbb238b4","observation_id":"767f32c3-af73-45db-9a21-063a76a9d3bb","resolution":{"observed_at":"2026-08-06T18:27:02.465774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-06T17:42:59.023990Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-07T20:29:46.771527Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:59.023990Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:56c0e0bb039d9b16450b7a6acf0a946b0cd35c2d5bbc81d47cbacf178d27eae2","observation_id":"526b2c15-4c8c-4ea7-8dee-d7cd56523cfc","resolution":{"observed_at":"2026-08-06T17:42:59.023990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-05T21:34:30.243849Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08413","last_updated":"2025-08-11T19:07:30Z","snapshot_observed_at":"2026-08-09T00:13:03.206488Z","submitted_at":"2025-08-11T19:07:30Z","title":"Decentralized Relaxed Smooth Optimization with Gradient Descent Methods","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T21:34:30.243849Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2508.08413"},"observation_digest":"sha256:944955fdc94a0b0964e80f73e614bcc45ad66b72183258e0f6cc8e58965858ea","observation_id":"54d71233-b41f-407d-9024-bd9fa7794d14","resolution":{"observed_at":"2026-08-05T21:34:30.243849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-04T13:00:08.709075Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01460","last_updated":"2026-07-03T20:18:07Z","snapshot_observed_at":"2026-08-06T09:14:15.682614Z","submitted_at":"2025-10-01T20:58:14Z","title":"The Three Regimes of Offline-to-Online Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T13:00:08.709075Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.01460"},"observation_digest":"sha256:6bee81a5ed59c5335f49fdd644e1c795d12d3227ed7640dfb3890222f4695216","observation_id":"61191bb3-ed59-4c20-bad3-3192f7dd2288","resolution":{"observed_at":"2026-08-04T13:00:08.709075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-04T08:45:50.812731Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.19528","last_updated":"2026-06-16T14:16:10Z","snapshot_observed_at":"2026-08-04T08:45:45.421057Z","submitted_at":"2025-10-22T12:32:52Z","title":"Learning Upper Lower Value Envelopes to Shape Online RL: A Principled Approach","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T08:45:50.812731Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.19528"},"observation_digest":"sha256:217da45c24f901477ad7b2cbdcb021b6cd41cd4aaeb30e458fbe365bb0d0cc35","observation_id":"f2dc4c0c-1335-4d2d-9833-b78d661542cd","resolution":{"observed_at":"2026-08-04T08:45:50.812731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2510.21060","last_updated":"2026-05-13T01:55:58Z","snapshot_observed_at":"2026-08-08T09:53:07.021031Z","submitted_at":"2025-10-24T00:21:38Z","title":"On the Sample Complexity of Differentially Private Policy Optimization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T04:43:58.646419Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2510.21060"},"observation_digest":"sha256:860964bbd1dbdfd290fecb53cf7d80da9368a1dfaefb858fcd27ecb8fb67030b","observation_id":"bfaca071-6b06-4792-aa97-c858755680ae","resolution":{"observed_at":"2026-05-18T04:45:54.791452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-03T00:05:19.691967Z","title":"A., Krishnamurthy, A., and Sun, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12107","last_updated":"2026-06-07T03:40:44Z","snapshot_observed_at":"2026-08-08T15:10:59.205706Z","submitted_at":"2026-02-12T15:59:42Z","title":"On the Complexity of Offline Reinforcement Learning with $Q^\\star$-Approximation and Partial Coverage","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T00:05:19.691967Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2602.12107"},"observation_digest":"sha256:ef32eff4234fa786a5ff4f8cd0a77b74e0fb16f75854a4cd8297e7508a13a795","observation_id":"5fe5774a-48df-4fd5-a21a-3bdccbd329b0","resolution":{"observed_at":"2026-08-03T00:05:19.691967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.04142","last_updated":"2026-04-05T15:00:29Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T15:00:29Z","title":"OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T16:46:30.674244Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.04142"},"observation_digest":"sha256:0f9136d8545f82df98a9e3a7b6ec812fd8851b9b63a7fafc8dddc99d6c0b60a3","observation_id":"0b234c6c-1aac-4e6c-8ffb-f70253b147a7","resolution":{"observed_at":"2026-05-13T16:48:02.892690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.08958","last_updated":"2026-06-11T05:02:53Z","snapshot_observed_at":"2026-08-01T22:02:36.657096Z","submitted_at":"2026-04-10T04:57:54Z","title":"WOMBET: World Model-Based Experience Transfer for Robust and Sample-efficient Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:05.636131Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.08958"},"observation_digest":"sha256:ac004151c7da0b4c23c847e1e52e1859e7cfb9fc0f073a936dcebf3af6863581","observation_id":"64a95906-4a9a-49a6-9fd2-4af53865b724","resolution":{"observed_at":"2026-05-11T05:10:54.307546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.13966","last_updated":"2026-04-15T15:17:40Z","snapshot_observed_at":"2026-08-08T02:57:57.796032Z","submitted_at":"2026-04-15T15:17:40Z","title":"Provably Efficient Offline-to-Online Value Adaptation with General Function Approximation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T12:55:12.531822Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.13966"},"observation_digest":"sha256:96bdae96720b357734140d675ac29e1f2fd1d9347a0ee6d5d6e5d788b8950e27","observation_id":"2de8b1eb-8296-4ad6-b7c6-3fdafcb22eda","resolution":{"observed_at":"2026-05-10T12:55:24.163245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:8e6386d3f708981cf20dde81b0a89a637eb3232ba7a2f75c75ef04db71225064","observation_id":"975e4bed-bd57-4f19-abf5-fb3ea33ed49f","resolution":{"observed_at":"2026-05-10T06:51:46.640676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T19:31:38.069592Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:ab4378c99ba1b6e5baa78e95a1c5f93adc41fbe3f7616edc5b739bf4c8aa71c5","observation_id":"49d113e4-ba79-4d98-8959-46d1516a6769","resolution":{"observed_at":"2026-05-11T15:36:12.446351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:51a99055e7706ba1ac124b0dcb29bd28666515fac872606072ea1e9ad6f420d2","observation_id":"39a0a6bc-4bbd-43fc-b36f-1e8850532b61","resolution":{"observed_at":"2026-07-01T08:15:32.342064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.05863","last_updated":"2026-05-20T07:46:09Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:32:09Z","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T14:54:30.895137Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.05863"},"observation_digest":"sha256:e2f451dcbe54c6b10a39542f31cab56631be4a112583c5460796abd9b8470e7a","observation_id":"0b2b7717-b975-48fe-9716-aed5571caef9","resolution":{"observed_at":"2026-05-11T18:41:08.508849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.05863","last_updated":"2026-05-20T07:46:09Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:32:09Z","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T09:15:11.280343Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.05863"},"observation_digest":"sha256:4218348ec0c709b6c83c23762a3e3baf062ca644f08d2b2d895a906f700889d8","observation_id":"fdc32471-d64f-439d-bd74-0d8826c39e84","resolution":{"observed_at":"2026-05-21T09:19:56.740644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.10289","last_updated":"2026-05-14T09:25:47Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:50:58Z","title":"Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T04:41:20.147645Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.10289"},"observation_digest":"sha256:a4f94c6628afccd57fded5e074b427d9616c2849985d4600fe54bd4c1486a615","observation_id":"796d031f-96a3-44c4-a061-5a62bb85114e","resolution":{"observed_at":"2026-05-12T06:01:24.988012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.10289","last_updated":"2026-05-14T09:25:47Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:50:58Z","title":"Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T05:07:34.344964Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.10289"},"observation_digest":"sha256:b7c9b022d48cc5c688438e208c91b29652267233865da3f5044e971e7804de7b","observation_id":"fe4e1566-4459-4778-935c-a9e6bb1344db","resolution":{"observed_at":"2026-05-15T05:09:45.449771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.14497","last_updated":"2026-05-14T07:35:58Z","snapshot_observed_at":"2026-08-01T11:14:55.109730Z","submitted_at":"2026-05-14T07:35:58Z","title":"ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T01:32:42.972836Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.14497"},"observation_digest":"sha256:9431e58476382d169f7e85fab87277ae7aa415fac5d361f2a41ceea48589bbb3","observation_id":"fb0c0acb-c715-42a3-90ff-ba797ec27a00","resolution":{"observed_at":"2026-05-15T01:33:27.192556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:de39f29ceebbdda23d01dde36781ca5dff9aadecd9623ec97ce14c6cf09cf072","observation_id":"acb0340c-2a99-43bc-9711-85dba150d4d4","resolution":{"observed_at":"2026-07-01T14:25:45.850150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:ac9d8281107db3aad7f65c862374bfab455a44b747e0a6415934aac5497bc6c6","observation_id":"634974ff-59c9-40ec-a2f8-321d59b8e1f4","resolution":{"observed_at":"2026-05-20T13:13:18.031118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2606.18531","last_updated":"2026-06-16T22:55:45Z","snapshot_observed_at":"2026-08-04T10:57:17.249083Z","submitted_at":"2026-06-16T22:55:45Z","title":"When Does Trajectory-Level Supervision Permit Efficient Offline Reinforcement Learning?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-26T22:06:24.412259Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2606.18531"},"observation_digest":"sha256:f617a22ee3f54ed6423739a395af094f9a201c0855c4d8e065e6badb47b141aa","observation_id":"c40f1fc8-4888-48af-ab4b-b102ebdd2e46","resolution":{"observed_at":"2026-07-03T23:29:02.983617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-25T19:29:00.117285Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2606.26006"},"observation_digest":"sha256:13c36408a7daae3078ffe96a0bb7b921ecf46cde02b325cacd4ea825d0b1a2e8","observation_id":"87b49c29-d6ad-4e76-8c37-c3c35c24bd8a","resolution":{"observed_at":"2026-07-04T20:50:12.308569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2210.06718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b90bf85c473cc7736fc2e003578a667f4e937929283e539feac6d59f40c46b87","observation_id":"c84440eb-076d-4640-b8b7-a7d1d2dbf63f","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-02T08:41:05.419064Z","title":"arXiv preprint arXiv:2210.06718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:05.419064Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:5bf100a1ce1743ae9aab15a1e6579314bfcc6a7ffbcaf0af69a38eeb81d142a3","observation_id":"8aa1f197-80c9-41b7-b6f9-9f1cb3891903","resolution":{"observed_at":"2026-08-02T08:41:05.419064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-01T03:13:35.351631Z","title":"arXiv preprint arXiv:2210.06718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25207","last_updated":"2026-07-28T02:27:27Z","snapshot_observed_at":"2026-08-08T15:41:36.505681Z","submitted_at":"2026-07-28T02:27:27Z","title":"A Unified Algorithmic Framework for Hybrid Reinforcement Learning in Tabular MDPs with Shifted Transition Dynamics","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T03:13:35.351631Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2607.25207"},"observation_digest":"sha256:bfcff6ca4b622a3cbfe00c6ee2bc133ef6f9e5303144691c10977861dbb0a728","observation_id":"3ae795ad-3718-4759-94ea-ce72fd92563d","resolution":{"observed_at":"2026-08-01T03:13:35.351631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2210.06718/citation-record","integrity":"/paper/2210.06718/integrity","json":"/paper/2210.06718/citation-record.json","paper":"/paper/2210.06718"},"outbound":[],"paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T06:10:04.416926Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2210.06718."}