{"as_of":"2026-08-12T16:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ba83906c22b6c853aa6e9c8bd88e5c812b1fe9d55299a650a6579c6616d6ef5","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:27:44.056272Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27203/citation-record","integrity":"/paper/2607.27203/integrity","json":"/paper/2607.27203/citation-record.json","paper":"/paper/2607.27203"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-08-09T00:12:49.246866Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-05T04:27:43.851239Z","title":"Ball, Laura Smith, Ilya Kostrikov, and Sergey Levine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.851239Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8aab9e8bdfdca8b34a7e2df62c7071ce32821cdf33ea1a12f0cc7ea1bd109856","observation_id":"fc8d6680-afd6-4aa9-abff-3fbe039a3cd8","resolution":{"observed_at":"2026-08-05T04:27:43.851239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-08-08T19:14:06.157767Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05450","snapshot_observed_at":"2026-08-05T04:27:43.855135Z","title":"Conrft: A reinforced fine-tuning method for vla models via consistency policy, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.855135Z"},"links":{"cited_paper":"/paper/2502.05450","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8f4125948f3524e6d4859ef6aac04853b6ad07dba6164a3e71201cb03bd1ff09","observation_id":"435b5e08-e59e-4b49-8514-ea7445d15ea1","resolution":{"observed_at":"2026-08-05T04:27:43.855135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07505","last_updated":"2025-06-09T07:32:52Z","snapshot_observed_at":"2026-08-09T00:13:18.509711Z","submitted_at":"2025-06-09T07:32:52Z","title":"Reinforcement Learning via Implicit Imitation Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07505","snapshot_observed_at":"2026-08-05T04:27:43.858412Z","title":"Lessing, Annie S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.858412Z"},"links":{"cited_paper":"/paper/2506.07505","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:d9a51da8739631e96fad8b7eba2f06c3f47fffd289ab7d151f0694d9d17c9474","observation_id":"49b28c9e-8205-4ea0-b167-2c60e716a353","resolution":{"observed_at":"2026-08-05T04:27:43.858412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07986","snapshot_observed_at":"2026-08-05T04:27:43.862543Z","title":"Expo: Stable reinforcement learning with expressive policies, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.862543Z"},"links":{"cited_paper":"/paper/2507.07986","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:48dd581c68d9804e1fcbf5e2987309ccdcfde5f59fc23eb0624da7ac72a7415a","observation_id":"3de1e9ba-ad4e-4dc2-8962-641f2c84653a","resolution":{"observed_at":"2026-08-05T04:27:43.862543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25477","last_updated":"2026-05-25T06:31:03Z","snapshot_observed_at":"2026-08-06T17:11:50.083428Z","submitted_at":"2026-05-25T06:31:03Z","title":"EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2605.25477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25477","snapshot_observed_at":"2026-08-05T04:27:44.399848Z","title":"EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models","venue":"cs.RO","work_id":"16fbb0ff-72be-4069-9be9-ee4e5c8acde6","year":2026},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.865881Z"},"links":{"cited_paper":"/paper/2605.25477","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8ce784569e82dec413d9dd1897b436595f50fced6e838a2f6a3779203f30b9b3","observation_id":"b753a510-00a3-4072-b11f-db5da5f4506f","resolution":{"observed_at":"2026-08-05T04:27:44.406212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:43.869331Z","title":"Tql: Scaling q-functions with transformers by preventing attention collapse, 2026 b","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.869331Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:4108e2d03c54c0065cf7bd5ed1b4a106d96b0df659c5b76763e3e22c064b20d2","observation_id":"4f1dd5b7-39d8-4d00-bd48-d23ff9b982ad","resolution":{"observed_at":"2026-08-05T04:27:43.869331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.07650","snapshot_observed_at":"2026-08-05T04:27:43.872344Z","title":"Value flows, 2026 c","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.872344Z"},"links":{"cited_paper":"/paper/2510.07650","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:7ba90c8092640c2b6f5caef4923da0c80854f5a67de2efbfc5c42313a3d6af83","observation_id":"dfb8630c-ab78-40c1-9a6e-8839ca96ed43","resolution":{"observed_at":"2026-08-05T04:27:43.872344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06860","last_updated":"2021-12-03T18:58:09Z","snapshot_observed_at":"2026-07-06T11:18:40.627866Z","submitted_at":"2021-06-12T20:38:59Z","title":"A Minimalist Approach to Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06860","snapshot_observed_at":"2026-08-05T04:27:43.875428Z","title":"A minimalist approach to offline reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.875428Z"},"links":{"cited_paper":"/paper/2106.06860","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:d79a6cec49e95f3a9e85e111fbd15e59844c88e6c3ea8200565e362f54d8b3da","observation_id":"1ba61b2f-ad5d-4c3f-90f1-50f313f9c14c","resolution":{"observed_at":"2026-08-05T04:27:43.875428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-08-09T23:42:27.348266Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-05T04:27:43.878960Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.878960Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8fb7ce9dd9753d61148e63d12523d7460ca0a42c0bee9ce59b36a91e2c060550","observation_id":"db5f9166-ea8d-42c8-b127-c020905a6e98","resolution":{"observed_at":"2026-08-05T04:27:43.878960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-05T04:27:43.882699Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.882699Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:0c401beb8fdf67b60ce673735c9719c1d1f4555af9acf61d97a0f73a83c15a2d","observation_id":"e76a3389-5aca-4375-83dd-25a19774da10","resolution":{"observed_at":"2026-08-05T04:27:43.882699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.705941Z","title":null,"venue":null,"work_id":"5f41d565-f550-47c5-9e66-ed9fe832fe16","year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.889168Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:5548b505c19e4d9c7dbc96f874b2a4391a082781162eae6d3e43fbf37dc3e6f4","observation_id":"30ce3aad-ceb7-4613-88d2-e5bc3e2ef94e","resolution":{"observed_at":"2026-08-05T04:27:44.708940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.03201","last_updated":"2018-12-18T23:40:20Z","snapshot_observed_at":"2026-07-06T07:19:53.854667Z","submitted_at":"2018-12-07T20:10:23Z","title":"Residual Reinforcement Learning for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.03201","snapshot_observed_at":"2026-08-05T04:27:43.895668Z","title":"Residual reinforcement learning for robot control, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.895668Z"},"links":{"cited_paper":"/paper/1812.03201","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:0d87da0a913ebf700c789945680b68e0c24d1e244496d3c845ed406987d4cd92","observation_id":"4ef21e19-4a49-49a0-bd4e-28aec6a260ac","resolution":{"observed_at":"2026-08-05T04:27:43.895668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02790","last_updated":"2018-11-07T08:01:21Z","snapshot_observed_at":"2026-08-06T18:21:07.562076Z","submitted_at":"2018-11-07T08:01:21Z","title":"RoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02790","snapshot_observed_at":"2026-08-05T04:27:43.899296Z","title":"Roboturk: A crowdsourcing platform for robotic skill learning through imitation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.899296Z"},"links":{"cited_paper":"/paper/1811.02790","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:66fb430a90c4b9a7032cbcce5be1c46257a63d3cfe85828adc08642fa9d87e87","observation_id":"8732657e-48fb-40c0-8468-94f37b81e5f2","resolution":{"observed_at":"2026-08-05T04:27:43.899296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-05T04:27:43.903146Z","title":"What matters in learning from offline human demonstrations for robot manipulation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.903146Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:4b18f2b4a8fc4e21ea928760bb0cda714f420cedf858e5fe86ac280cd9225413","observation_id":"3b1a3d1c-7b99-4f72-a8d7-3ff78b3bd4d5","resolution":{"observed_at":"2026-08-05T04:27:43.903146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-05T04:27:43.909990Z","title":"Awac: Accelerating online reinforcement learning with offline datasets, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.909990Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8900977bcce22e269116f4d21f2ef71e03259fc7e7d5cdd83e478eca4bb3eaef","observation_id":"58830bf1-7272-4d8e-91da-9c5b9b5759ea","resolution":{"observed_at":"2026-08-05T04:27:43.909990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05479","last_updated":"2024-01-20T03:51:39Z","snapshot_observed_at":"2026-08-08T05:31:09.360131Z","submitted_at":"2023-03-09T18:31:13Z","title":"Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05479","snapshot_observed_at":"2026-08-05T04:27:43.913078Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.913078Z"},"links":{"cited_paper":"/paper/2303.05479","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:a42eda09235830ec6ad302da4145df47385212e63e1f662eb90739ba639de62c","observation_id":"bc29c0e7-e20b-4a77-80af-d7e93fb93bb6","resolution":{"observed_at":"2026-08-05T04:27:43.913078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T04:27:43.916046Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.916046Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8305361a60e646145bdb92b47f5488f0fabe1ec5e74ab1cc73ba3d366954a7e2","observation_id":"9ed5d8e6-24f2-4902-a4e4-8c77af3b4e91","resolution":{"observed_at":"2026-08-05T04:27:43.916046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-05T04:27:43.918926Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.918926Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8ac375bb27dfaf494d6d1373223bde9e878dea786fcd6bc44a4236b78681b030","observation_id":"59243467-6b8b-404f-be6d-410361a58dae","resolution":{"observed_at":"2026-08-05T04:27:43.918926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-09T11:47:17.453701Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-08-05T04:27:43.921979Z","title":"Flow q-learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.921979Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:427daea73f085cc21186ac7d5ad38dc71d7d3a1dbc93d01d4ba3eb9befd89a7f","observation_id":"56944067-1641-4a97-b8df-a49a69282f82","resolution":{"observed_at":"2026-08-05T04:27:43.921979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-05T04:27:43.925054Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.925054Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:20ed7e0cd82f4b1cff2a1be1e9bbb168e223499b781fe604855091ac77275bd7","observation_id":"5f3bcbff-1be5-4146-9a4e-5b34e7f19672","resolution":{"observed_at":"2026-08-05T04:27:43.925054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-05T04:27:43.928017Z","title":"Ren, Justin Lidard, Lars L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.928017Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:6ca18da6d3d262108c3f75bbf7e01dd3ce468cd436fc70078eb87b8281a6b6a5","observation_id":"7d59be1e-05dd-4196-8f89-cffe8033cd6b","resolution":{"observed_at":"2026-08-05T04:27:43.928017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.697575Z","title":"Learning from demonstration","venue":null,"work_id":"69d38a74-cf46-4da7-9d15-f29ad153ce35","year":1996},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.931195Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:91aae0acf2fe229574e3fa38d7aa4c908911cf388b2b304f4b96f50433b93a66","observation_id":"c59d1e37-14ea-4bb7-b8ce-d3f0f8f81e93","resolution":{"observed_at":"2026-08-05T04:27:44.700434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T04:27:43.933855Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.933855Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:640f716add4267f1044101c9d6b41303367592af58ffaeebf5ff0efd754d9224","observation_id":"32783b5f-8530-4ddd-ac87-dceba0a00845","resolution":{"observed_at":"2026-08-05T04:27:43.933855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06298","last_updated":"2019-01-03T18:11:15Z","snapshot_observed_at":"2026-07-06T07:21:24.277262Z","submitted_at":"2018-12-15T14:47:21Z","title":"Residual Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06298","snapshot_observed_at":"2026-08-05T04:27:43.936921Z","title":"Residual policy learning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.936921Z"},"links":{"cited_paper":"/paper/1812.06298","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:489d256201e757938bda9cf3c7bbe9f21263df90df444f8d9b9d9584d7d8746b","observation_id":"63bc5cb3-043d-4cd5-89ed-347195cd729c","resolution":{"observed_at":"2026-08-05T04:27:43.936921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-05T04:27:43.940482Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.940482Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8a138caf7f9f2004c60bb28b652debd6846bf3c38735dcd416431900203fba6c","observation_id":"cb0d603a-dfea-4cfe-a598-f91434d33dae","resolution":{"observed_at":"2026-08-05T04:27:43.940482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.688323Z","title":"Jump-start reinforcement learning","venue":null,"work_id":"873236e6-4d29-4305-8c9b-20fe15853071","year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.943635Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:3b6a28ba935c0af738c63d09d101fab231416afc34b4f650135ea8db191979b5","observation_id":"3bb83959-8101-4961-9f60-cad24838613f","resolution":{"observed_at":"2026-08-05T04:27:44.691778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-10T07:54:23.821978Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-05T04:27:43.946235Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.946235Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:b78af7c2ed65a45ddb4afce900d51782500bdd238cab594ac95b4aac7e3036c6","observation_id":"5cb8093f-1c55-45d5-b11b-e15ab67eeaa8","resolution":{"observed_at":"2026-08-05T04:27:43.946235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:43.949288Z","title":"Posterior behavioral cloning: Pretraining bc policies for efficient rl finetuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.949288Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:99b74685663b1c0abef16db0f8d859188c931bdc5bcbcdf853a099541f6df3ae","observation_id":"b9a10551-8f68-4ff2-845b-e4b2c0c6343a","resolution":{"observed_at":"2026-08-05T04:27:43.949288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.679224Z","title":"Hybrid policy optimization from imperfect demonstrations","venue":null,"work_id":"ba98ff34-6a54-4590-921d-ed5b4df3b210","year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.952021Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8dc4bf5da63449aa0d74cf81c023f25e60d4c1d931d4b0ec87c438b70cb03ae6","observation_id":"927ceae2-6df2-4eb7-b7a2-05f2ce14d0a3","resolution":{"observed_at":"2026-08-05T04:27:44.682421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-08-09T22:12:29.385993Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-05T04:27:43.955043Z","title":"Policy expansion for bridging offline-to-online reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.955043Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:e211bff6312cc67169927bd8bd268d801a92ac13cc1b6b095794c8f88ce7c224","observation_id":"94deceb8-0c11-4433-b87a-394c4ee5677b","resolution":{"observed_at":"2026-08-05T04:27:43.955043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-08-12T08:03:44.451117Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-05T04:27:43.958427Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.958427Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:e1574cee34b446b5341a7b7c6725db13778e69942502f6781ab2548bc5d4432a","observation_id":"dce039d1-cbdd-4a12-8533-f5f4580e6e34","resolution":{"observed_at":"2026-08-05T04:27:43.958427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.670619Z","title":"2024 , eprint=","venue":null,"work_id":"65c2d562-a5b8-4b44-9b56-5d259e2e0dcb","year":2024},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.961450Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:fdfdc26a80df1e547d666433e2f975c0ae53c61a5523eda75c36d564172687c3","observation_id":"1066cbd0-4f29-44c3-9c82-b26fb9b31e4c","resolution":{"observed_at":"2026-08-05T04:27:44.673796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.662333Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"e48547b9-05f0-4108-a4f8-a23630731da9","year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.964400Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:db94fd3cf000686f8abc4e2ba5d76fe6dbd7e0d583231d312f9b034fd3dba99e","observation_id":"7835ab6d-fdf0-4e5a-af30-89b276e89431","resolution":{"observed_at":"2026-08-05T04:27:44.665295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.653551Z","title":"2025 , eprint=","venue":null,"work_id":"d5990080-0c36-4d94-841b-d8309aea11e6","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.967979Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:fff3b7d4ff03d860f72843e9aeb22bca12793d0ebac4ce5e1775af0d3530ec9c","observation_id":"78f74e7c-1372-412e-805e-151b93895833","resolution":{"observed_at":"2026-08-05T04:27:44.656865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:43.970826Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.970826Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:6b379035ba80533d0bc3380dde1fb383ff7d198db53ea873c2b6f3edffe8b43a","observation_id":"ff6ca7d4-31ee-4b3f-86c9-dae97b4d45b1","resolution":{"observed_at":"2026-08-05T04:27:43.970826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08558","last_updated":"2023-10-12T17:50:09Z","snapshot_observed_at":"2026-08-12T04:05:46.051568Z","submitted_at":"2023-10-12T17:50:09Z","title":"Offline Retraining for Online RL: Decoupled Policy Learning to Mitigate Exploration Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08558","snapshot_observed_at":"2026-08-05T04:27:43.973679Z","title":"arXiv preprint arXiv:2310.08558 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.973679Z"},"links":{"cited_paper":"/paper/2310.08558","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:90bc4efbb8fe339fcac1ac75516c32f7a01cb05695e20bb24d003ac2fde8aefe","observation_id":"39bfc212-b23c-4369-ad9b-b4b6baa6585e","resolution":{"observed_at":"2026-08-05T04:27:43.973679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.638334Z","title":"2025 , eprint=","venue":null,"work_id":"268cc5ac-aea4-483d-8ebc-50419d204ec6","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.976727Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:33f9792d4117d40e728c215d3c899f32f107408f19695052586415e9490405eb","observation_id":"8694ecfc-f619-4c79-bc33-0cc52e54f1d3","resolution":{"observed_at":"2026-08-05T04:27:44.641172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.629794Z","title":"2018 , eprint=","venue":null,"work_id":"01dd6f58-515d-4112-8361-e33b57c29a8e","year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.979698Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:1790b3c9a5e1603ff5b70606f6fab3485bdce48ca54fa5cf0fca0260c3d637e5","observation_id":"0d33480c-c323-4ef5-881f-ccfe952540f4","resolution":{"observed_at":"2026-08-05T04:27:44.632942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.621293Z","title":"2025 , eprint=","venue":null,"work_id":"d41af624-8f2c-4203-aaa1-dc76c94b074f","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.983043Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:817a83234c55e82c73a7d947cf48ef3ae7620fa0236ca4b651585d7e5ef08922","observation_id":"e789b70c-4153-4194-9bf6-a7c476d0876e","resolution":{"observed_at":"2026-08-05T04:27:44.624224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.612925Z","title":"2025 , eprint=","venue":null,"work_id":"7444215d-92f8-46f2-abfb-cc779032183c","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.985785Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:1b3e9bdf3e06c7c03237d30c954b0f0c2b5fdf2c3bf7ae8990927a0796e35b53","observation_id":"d1980857-ee60-4eba-9aa3-c30134053f99","resolution":{"observed_at":"2026-08-05T04:27:44.615817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:43.988561Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.988561Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:49c4ff2602e0a7638f7fcc1d10c487e6b712eac759c5deb9a0a341f1dd943af4","observation_id":"dcf5a4ef-cd04-41e1-9252-af049d922457","resolution":{"observed_at":"2026-08-05T04:27:43.988561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.599753Z","title":"2026 , eprint=","venue":null,"work_id":"3ca95707-6548-4e20-9186-d12c87f84f42","year":2026},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.991903Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:a9063aed581d1a5f9e6a39876ff07bd569347d9204e606cdb84af992a1af39a2","observation_id":"d2787269-2f10-4c59-a4c2-3dec0ccc7b6f","resolution":{"observed_at":"2026-08-05T04:27:44.602667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:43.994697Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.994697Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:15760cd349cd5bfc8ea8425c7c76272102d00549506230c6faff0c3d4e381e83","observation_id":"6e3502c1-8b5f-4acf-8f1a-3b3868634f40","resolution":{"observed_at":"2026-08-05T04:27:43.994697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-05T04:27:43.997602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.997602Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:710e833d8c76d9b05c54321eec5ce931440c4b86e86f22fb6f8e629a23093518","observation_id":"261c0147-f982-4990-b942-df7184291f2e","resolution":{"observed_at":"2026-08-05T04:27:43.997602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.586532Z","title":"2026 , eprint=","venue":null,"work_id":"9ae9a2be-2d0c-4f28-b846-325f87df3147","year":2026},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.000430Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:a6771259bb6ee3a9ab8e75088346724dc18851d7e7b30afc9133177a9214d024","observation_id":"96736635-cc01-4463-a940-97b4f349a94e","resolution":{"observed_at":"2026-08-05T04:27:44.589458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.004064Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.004064Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:8a221e3188b44025c268ee3cfb2007f0dfb251802f94b0a02fcac3c8a7922967","observation_id":"e588344d-82c4-4db6-9258-71db439f99c9","resolution":{"observed_at":"2026-08-05T04:27:44.004064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.572513Z","title":"2021 , eprint=","venue":null,"work_id":"66302e2d-b522-49e9-b131-5fa17aa67640","year":2021},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.006852Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:a3e85c9cde3f5245ea35c2f9f8ab52b2ceebfabaedcfdd2f3892775a244fccf9","observation_id":"3340c488-d9d8-4969-8f98-e65a4360125b","resolution":{"observed_at":"2026-08-05T04:27:44.575786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.563654Z","title":"2018 , eprint=","venue":null,"work_id":"cddf6b67-d749-4578-8c3a-e4012287380e","year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.009721Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:eaed004ea5491280cded11d4567284d70df677d2d7ccdeed5607b1b81e7ba94b","observation_id":"6e818da6-7c3f-4ff9-85f4-d8474843bbfa","resolution":{"observed_at":"2026-08-05T04:27:44.566579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.555162Z","title":"2021 , eprint=","venue":null,"work_id":"39e579c4-4fe0-4991-b5b7-49987403c034","year":2021},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.012520Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:dd557373d1a9394b5fd3e91cb7d41debd6c3200a68e515e8c0dfcef1e2898b15","observation_id":"ff2fc180-aa2b-46f3-ae96-a689cd150192","resolution":{"observed_at":"2026-08-05T04:27:44.558137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.546612Z","title":"2025 , eprint=","venue":null,"work_id":"561e1458-674e-4e74-afa1-8c3d320aa1e8","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.015214Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:ff275ee39c5cc34367ebd8f3e433f6dffe0eba0fa0c85a313f4ef464803c184d","observation_id":"abc7736b-dbb5-47b9-a59f-a4c8830b68ad","resolution":{"observed_at":"2026-08-05T04:27:44.549631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.538047Z","title":"2019 , eprint=","venue":null,"work_id":"89d26412-fc26-4e46-a347-f2ffc39c4331","year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.018125Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:5d1e419fad660f08439949870a751a6fcef35e81f6b4fffdcbc3a42bab1b50b5","observation_id":"8e547edc-336b-4161-8db1-bd7993eca08b","resolution":{"observed_at":"2026-08-05T04:27:44.541037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.529347Z","title":"2018 , eprint=","venue":null,"work_id":"d198e206-8f12-4129-b127-b6333c5190c1","year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.021235Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:375f7aadff2790e58aa98d9fe07f807c04abad8b643727abcc3b54e87c7d0e1c","observation_id":"d034223c-a59b-4923-ac80-a71d0870a309","resolution":{"observed_at":"2026-08-05T04:27:44.532567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.023977Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.023977Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:08eb4d6e9ec07930bb82dac9eacc36e7360f598d0c84aca26b60bfc0058e0167","observation_id":"c8d85fc6-f76f-49cd-a26c-0f1333988e7a","resolution":{"observed_at":"2026-08-05T04:27:44.023977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-12T08:38:17.705986Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-05T04:27:44.027011Z","title":"arXiv preprint arXiv:2311.02198 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.027011Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:2a2cd7a4351dcd406927bafc9302b542301603f7220368449ec34ffbdd5fc4ad","observation_id":"47dd6549-d3ae-4431-af91-e43b699b93cc","resolution":{"observed_at":"2026-08-05T04:27:44.027011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.029744Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.029744Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:0ce8f63ada30dbd06f2c97c67b6d4c8dc36143f7375b93397225e90f6ea4a2dd","observation_id":"3f7ed219-f687-47a8-997d-2073b0fb3a45","resolution":{"observed_at":"2026-08-05T04:27:44.029744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.510825Z","title":"Learning from Demonstration , url =","venue":null,"work_id":"148a7e57-d771-4e58-9662-408b8a7c45c6","year":null},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.032496Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:12c7a9d35f5ec6e6c62e1ee9f6b68308ea8555321d51285343e9e8a92da34142","observation_id":"b2d80ac2-af79-401f-8317-cec902a0e667","resolution":{"observed_at":"2026-08-05T04:27:44.513790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.501785Z","title":"2018 , eprint=","venue":null,"work_id":"940e4150-d8ae-4fe0-b94b-832b46db05c3","year":2018},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.035984Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:1e40147c9a596bace60915c5085922f122d8ee7972221cc01ae352bd1aa304a5","observation_id":"a4a62e94-6014-4bc9-8471-5a6f91f827f0","resolution":{"observed_at":"2026-08-05T04:27:44.505056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.038696Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.038696Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:80d61e0f2d1e9165bad7d864b658357736834b858fcfb60d2bc35f1a2a6e08d3","observation_id":"c5580547-0659-4f5a-bcce-2ef08c83c0a9","resolution":{"observed_at":"2026-08-05T04:27:44.038696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.486468Z","title":"2025 , eprint=","venue":null,"work_id":"423f75f9-d370-44e3-b6b3-91f2a654441f","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.041526Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:2c3fa61dbea3f694c5e9c1431e00fb3cb3317bc3546cfdc76e52d0a96cf1a67f","observation_id":"388ee01e-ae08-48d0-a270-2a8eb908f0e5","resolution":{"observed_at":"2026-08-05T04:27:44.490436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.477683Z","title":"2026 , eprint=","venue":null,"work_id":"40d596b0-48c4-44fb-b124-74a133544e87","year":2026},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.044253Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:da13fcad74cf130871bb7d0afc0cf316bf9df82200ad1d0e18cf136080353ea3","observation_id":"f4d91b64-1675-4b94-a1a9-8fd81f082c41","resolution":{"observed_at":"2026-08-05T04:27:44.480664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.469054Z","title":"2025 , eprint=","venue":null,"work_id":"d4af271e-ff75-4e80-8917-bcbace8eed35","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.047941Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:a0a92720ffc87a8129450dd6971c054a33a93f72e089fabb4dc7bf1f6e0e172a","observation_id":"b68ff781-7502-41e6-912b-c022c4320ba4","resolution":{"observed_at":"2026-08-05T04:27:44.471999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.459503Z","title":"2023 , eprint=","venue":null,"work_id":"ac37dd6b-117d-493b-a695-fb1646d1a5c4","year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.050890Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:53b2512c178e9c3a35583680866f5647c2b8447ca0db810f07103e4983c8f64b","observation_id":"c548dbad-505e-48e7-9df4-4407752df131","resolution":{"observed_at":"2026-08-05T04:27:44.462445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.450934Z","title":"2023 , eprint=","venue":null,"work_id":"96ea6ca8-2c79-45f5-b77f-6966bb0b0a18","year":2023},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.053550Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:316748d3abe59377d092b3c2fe4d68477715089f414628e7fcab4060c709ed23","observation_id":"494a7ca2-e0ed-46dc-8428-a1cd07b0dfa0","resolution":{"observed_at":"2026-08-05T04:27:44.453888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:44.442346Z","title":"2025 , eprint=","venue":null,"work_id":"b31e62f9-069c-41ab-8bd9-aa64684dc920","year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:44.056272Z"},"links":{"citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:0ab81535b23358db70311c93ba093885344dcef9bd955d6125f92753c1ceb5a9","observation_id":"48b63200-b705-4a67-beb3-e8378cfcfaf2","resolution":{"observed_at":"2026-08-05T04:27:44.445380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T08:40:27.754802Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2607.27203."}