{"as_of":"2026-08-10T13:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7eb21b9fc41ed5df98afd783574d219e6e6920f288e07cb9f3a0c9f62a38b774","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:57:38.738111Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:03.382391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.703268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-06T04:39:03.382391Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.382391Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c6e15c6fe031f81307380fdda624c35df8d7e93776c045a51880dc2b77c69275","observation_id":"56a88053-8484-4f20-8e2e-d2afacf86fab","resolution":{"observed_at":"2026-08-06T04:39:03.382391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":298,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:aaecebe7cce5ed7fa60fb754fcb82b257d4f09993d21a1fa03f0fbc140657b70","observation_id":"f55dcc61-54c0-42e7-b913-376652390503","resolution":{"observed_at":"2026-05-18T00:02:24.819691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2604.04142","last_updated":"2026-04-05T15:00:29Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T15:00:29Z","title":"OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T16:46:30.674244Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2604.04142"},"observation_digest":"sha256:1218e74f0c38354ddc1f54f1be623f6e776a3072d1275e430d90e19c17ac0d56","observation_id":"70c6515c-dc0f-448b-9b73-832627027942","resolution":{"observed_at":"2026-05-13T16:48:02.883638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:a97c09fd912f957bdc009ddb6a7bdd0c89238dc64db310e753e10b3d9d2be341","observation_id":"387033bb-6cb1-4f23-9b62-1a342820f39f","resolution":{"observed_at":"2026-05-11T11:41:04.087868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T04:29:21.897215Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:26962f5ee645f8985c72521dfaa05871d7ba27f2c57cf545b4075224ba80c945","observation_id":"b66fa036-e05a-4695-81bc-fef0a840ab7d","resolution":{"observed_at":"2026-05-11T11:56:13.385814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:857501f0ecff6b458bc2bf3e078da6e3ccba1b40388af8edf42d68404df7e595","observation_id":"6b03ad2d-f6af-45dc-92fa-3ad994e68e0a","resolution":{"observed_at":"2026-05-10T23:15:49.306961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-07T08:55:02.984200Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:77552848d99466d317665be908160fb4315827299f8046c70efae31e4de857af","observation_id":"92c5b202-9bfe-4c5c-b64a-08617c072a60","resolution":{"observed_at":"2026-05-13T05:07:17.618672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:a521599a16939a6f762292de9989747050bb7f48126f7713a8a4cae6443c30bd","observation_id":"1d775364-fee8-466c-b897-6c43696ec376","resolution":{"observed_at":"2026-07-01T21:16:13.350886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:060c3076af122a45d756def07f07944b30d5b517470f091535f0f4d678894b07","observation_id":"8710f2d7-6436-4e9b-b31c-6062714716a8","resolution":{"observed_at":"2026-07-04T08:09:40.704821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model.arXiv preprint arXiv:2507.06892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:703b2489666bc21e5c2bf94b89d06b356b7e948d421d357d7b4cb782db81b390","observation_id":"894710be-2893-4b06-bcb2-48495fcf0ba9","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-14T11:23:30.063231Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T11:23:30.063231Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9d13c2a4bf220eecdad41ed7fc42372d4a3369f118eb5f0a1ba055fb5cbbe86a","observation_id":"4830619b-67bb-4586-920e-a111b79b15f6","resolution":{"observed_at":"2026-07-14T11:23:30.063231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-02T07:23:28.818300Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.818300Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:4466b01ff4fa66e6c63ad8fc1593efbb135e05cbb88dd8dca213556f83aee9ed","observation_id":"a6ba5694-badf-4fad-8793-20ff8e40f96b","resolution":{"observed_at":"2026-08-02T07:23:28.818300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-01T12:54:27.855935Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-07T08:18:38.032175Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:27.855935Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:1024694e78b62ecde995690f41c666e79821ec46daa1dacba2ff9c1cc2c1ab17","observation_id":"f8a5b6de-1ab0-41b3-90ec-3cb6462a186e","resolution":{"observed_at":"2026-08-01T12:54:27.855935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06892/citation-record","integrity":"/paper/2507.06892/integrity","json":"/paper/2507.06892/citation-record.json","paper":"/paper/2507.06892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.682384Z","title":"Courville, and Marc G","venue":null,"work_id":"f7cfec2e-a9a6-44d8-8c82-166355565413","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.569907Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:8981d788f1fefde02435fda27f697cede7693b7001ced2ae080afb5d3aa96206","observation_id":"2610c449-92c3-4237-b68f-837cb95d3efd","resolution":{"observed_at":"2026-08-06T18:57:39.685294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T18:57:38.573983Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.573983Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:bcf93af91ab2cff665cfe3881a4103cbb64cee2994aa5fa871b77a7792173001","observation_id":"c77a04f0-b335-4aca-835e-cf99a9b82da2","resolution":{"observed_at":"2026-08-06T18:57:38.573983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.673457Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"dfbeab93-9a65-4ff2-a359-453bdfd8f291","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.577490Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:63929dd60eda0c3599e98a2a85bd69edc697d030f6aea65d30428fb4ef9cc292","observation_id":"2cb985f7-c2bf-461d-b3b7-ddd22a85de4a","resolution":{"observed_at":"2026-08-06T18:57:39.676627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.580390Z","title":"Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.580390Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:c915ac0c281b0c60c952cca25246dbd86710834111ed64378a921ebe7a4f07b1","observation_id":"80e48911-6d5a-4f96-b991-58bd963bb06b","resolution":{"observed_at":"2026-08-06T18:57:38.580390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.583323Z","title":"Asymmetric reinforce for off-policy reinforcement learning: Balancing positive and negative rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.583323Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:25160a0c8d8e73d788b04bde2587983cf7b25babff65e8b70a435cfefc30c3fa","observation_id":"4ad64ff2-e8d6-4a4e-8250-b65159d4fdfd","resolution":{"observed_at":"2026-08-06T18:57:38.583323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T18:57:38.586349Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.586349Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:5e77bd1aecc1759c527ddeba53ba8f4ca57eb34be112e4a8e50fc437dca83190","observation_id":"9f0eee0b-866b-48b0-bc3d-b6799b1b46d5","resolution":{"observed_at":"2026-08-06T18:57:38.586349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T18:57:38.589705Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.589705Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:85a94889004b7faf477ab3054f31791322b477fe7c90892b87febc9c8602635b","observation_id":"c988a462-281d-4c88-acf0-f800fc8c8105","resolution":{"observed_at":"2026-08-06T18:57:38.589705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.658058Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":"4256e277-790c-436f-bb40-8cb96d77465e","year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.592847Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:b649604abd0a38fec97670c885b2841f89fed530611657481780daf3c040fd61","observation_id":"dfd95391-ebaf-41cc-ac93-6aefd7da941e","resolution":{"observed_at":"2026-08-06T18:57:39.661204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-09T23:26:41.871607Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T18:57:38.595495Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.595495Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4a99316dd50fce01e91a615541f1309d202aae827d9821fff4fab4ecad19f4db","observation_id":"162c4416-8a67-4ce8-9d07-a7313e31f590","resolution":{"observed_at":"2026-08-06T18:57:38.595495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05453","last_updated":"2025-03-07T14:23:40Z","snapshot_observed_at":"2026-08-09T12:44:35.937148Z","submitted_at":"2025-03-07T14:23:40Z","title":"Soft Policy Optimization: Online Off-Policy RL for Sequence Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05453","snapshot_observed_at":"2026-08-06T18:57:38.598767Z","title":"Soft policy optimization: Online off-policy rl for sequence models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.598767Z"},"links":{"cited_paper":"/paper/2503.05453","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:fa75bf23b030071dc3e538758c350e6161f5e33636344e93c3130840b7a3f6bc","observation_id":"2ea8bd9b-b671-4073-ae7e-c9bc97ee0670","resolution":{"observed_at":"2026-08-06T18:57:38.598767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.601641Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn't","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.601641Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:22180a99181101844dbe6e0e9f66f27bbc9d3db153cd446180b274f9ad320750","observation_id":"70a7c6b4-3295-4808-be17-964e2c5f0e00","resolution":{"observed_at":"2026-08-06T18:57:38.601641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.648724Z","title":"IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"0bd6c215-3ca0-4921-b880-b1120b66a080","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.604364Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:8390867c656dc681758814e3de8cca72cf09d1ce91f24568236c5771ddcdb809","observation_id":"393233f6-6531-4951-acab-e6f7ab0deac5","resolution":{"observed_at":"2026-08-06T18:57:39.651742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.607005Z","title":"Concise reasoning via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.607005Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:d4c3085df15c3e70c1c52a3d5618ab26928b4a040e60b2fbaa616084ce0ee0b2","observation_id":"16e72a72-22cd-4a63-95f9-04c69ebf38df","resolution":{"observed_at":"2026-08-06T18:57:38.607005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.639636Z","title":"Fujimoto, H","venue":null,"work_id":"66a0a69c-1c55-4867-be9c-6d1e6aacc7b6","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.609444Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:f3bb6f69c6f52a17593e93baa939d8807fb3f64936f75a971e7510326f412259","observation_id":"ed5e93d1-783f-4001-ad8c-aa6e1b1e5aa8","resolution":{"observed_at":"2026-08-06T18:57:39.642671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.630811Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":"059f7541-6046-41f8-9619-37897fd21085","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.612270Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:58558712d46e3be5ee4fe96c9d4ac0bb8d5c6bdffc94aced5aef6b463db5bf72","observation_id":"a900bc4e-07ba-4cc7-83f7-964739ef6ac6","resolution":{"observed_at":"2026-08-06T18:57:39.633868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:57:38.614872Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.614872Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4ae8987e9d8b6421f19f88f06d9d6507d79bab589862a2b502fbfc994853077e","observation_id":"70b85926-1f13-48d4-84d2-16cf5324ca0b","resolution":{"observed_at":"2026-08-06T18:57:38.614872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.621712Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"55b580aa-6071-495a-ac7e-3a2d13fb8ef2","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.617608Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:720a18dcb279add46f841f1906beff173a29b1b43cb8c9cbdc7db6d455df72b5","observation_id":"be9c56bf-41f2-45f6-b4da-2a02afdfffcb","resolution":{"observed_at":"2026-08-06T18:57:39.624855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.612422Z","title":"O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"044df911-93de-44e7-bf87-71d443a50c75","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.621112Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:a1131f528c8ea2522b74282bdb08e73adc622b51c9c3d9a7f27e77f4f2718f91","observation_id":"12e65803-a1fd-4ef8-a8de-6ab262a11134","resolution":{"observed_at":"2026-08-06T18:57:39.615595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-06T18:57:38.623857Z","title":"Skywork open reasoner 1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.623857Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4b329a8851aad526ff2e0d604b234a5f272fc8e0933976cd13d6290ede6ccdb6","observation_id":"eac0ca50-77da-4c6d-b617-3f70d76a2fe7","resolution":{"observed_at":"2026-08-06T18:57:38.623857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.626666Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.626666Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:33b225bb07b6470f1bea753c590734864e461263b755aca641513cf8fb5e7f69","observation_id":"04b5bf4b-de32-4e61-97f0-9d47fd639b78","resolution":{"observed_at":"2026-08-06T18:57:38.626666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.597464Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"bdd1c487-7e49-4147-b99d-b648c858228b","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.629274Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9814cd71af206dc4da373a1a10c4ae9353759f5ce068e5528013a29976ee3d48","observation_id":"3328c8a4-0c39-45d6-89c0-85eb10fc3582","resolution":{"observed_at":"2026-08-06T18:57:39.600557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-08T23:30:41.427380Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-06T18:57:38.631941Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.631941Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9320ce6c65b72d2233fbf4c67b0439144817703e5ad7a11f28c8b7e309f3f543","observation_id":"a378b549-95f8-4ce0-962c-75f61d17b505","resolution":{"observed_at":"2026-08-06T18:57:38.631941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.588477Z","title":"Ii-thought","venue":null,"work_id":"3c1c1376-468a-4325-8482-731b8f3d4bb8","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.634606Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:cc09fa73bfb58d23b9ed3c9c3f10770b8dc5df16d83c0030939aaa2b96f3f536","observation_id":"7cfd7d7e-9d71-4916-8f80-8d1013ceb891","resolution":{"observed_at":"2026-08-06T18:57:39.591562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:57:38.637134Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.637134Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4a575a1b8a08eb46251bf57c09481aeafefbfc1a101c5d268647e9a8fb934f50","observation_id":"683bc374-3d9e-40c1-aa52-0171f9784ca8","resolution":{"observed_at":"2026-08-06T18:57:38.637134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06271","last_updated":"2023-10-10T03:05:44Z","snapshot_observed_at":"2026-08-04T12:23:50.873448Z","submitted_at":"2023-10-10T03:05:44Z","title":"Towards Mitigating Hallucination in Large Language Models via Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06271","snapshot_observed_at":"2026-08-06T18:57:38.639909Z","title":"Towards mitigating hallucination in large language models via self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.639909Z"},"links":{"cited_paper":"/paper/2310.06271","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:c7f967f37d8dda88b5310d4caf633160b36ed356ee5201dec4f463d26b7cae2d","observation_id":"354f7b51-4215-4f86-b33f-d8765cb4fac0","resolution":{"observed_at":"2026-08-06T18:57:38.639909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.579387Z","title":"Kakade and John Langford","venue":null,"work_id":"7fa44b20-0dfd-4886-9568-3beb8e2b1a02","year":2002},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.643545Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4bd475014e96baf4d98bb848c0f2f673bd9630f8c321f32bc529acf3578a8e1a","observation_id":"381f4a2a-5caf-4152-a782-427d95387ff5","resolution":{"observed_at":"2026-08-06T18:57:39.582131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T18:57:38.646294Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.646294Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:03f5ab252e5c1c3f8d231b2e57cc9322e53428f6efb18a818b8d1289638ad511","observation_id":"cd2317f9-283c-4d90-addd-5786421cb595","resolution":{"observed_at":"2026-08-06T18:57:38.646294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.570302Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"035833a1-a7f7-492f-9b67-fa37dae5c21e","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.649173Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:66473436129de0ec4f2abdedb5f4e99fcb47f4fb2edcd8a18288e9973c49491f","observation_id":"5c9e9e1f-94cb-4ccc-8aab-1cf469a1c64d","resolution":{"observed_at":"2026-08-06T18:57:39.573429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-08-08T13:48:32.149553Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09340","snapshot_observed_at":"2026-08-06T18:57:38.651814Z","title":"Repo: Replay-enhanced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.651814Z"},"links":{"cited_paper":"/paper/2506.09340","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:0807b7d75eac56859bbf34922279b9792a75d95365d0ef0f8f6464c39418e98a","observation_id":"9a63b81c-201f-4b0c-8e2b-08465d99b10d","resolution":{"observed_at":"2026-08-06T18:57:38.651814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T18:57:38.654774Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.654774Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:11a12ee7d6436136b8f7b5b102a2931f7c12324add2b3e139190b7682eb73394","observation_id":"1ef5b0fc-e36b-4d2a-89a9-c32b6b72ce9c","resolution":{"observed_at":"2026-08-06T18:57:38.654774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14245","last_updated":"2024-02-22T03:14:03Z","snapshot_observed_at":"2026-07-06T17:33:45.647306Z","submitted_at":"2024-02-22T03:14:03Z","title":"Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14245","snapshot_observed_at":"2026-08-06T18:57:38.657416Z","title":"Enhancing robotic manipulation with ai feedback from multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.657416Z"},"links":{"cited_paper":"/paper/2402.14245","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:698c675c9bd5358931d19994221ed25de3c3cba5595be4934b9e6cb00765bf68","observation_id":"77054f07-b2a7-4362-8750-e8324c27da23","resolution":{"observed_at":"2026-08-06T18:57:38.657416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15944","last_updated":"2025-03-20T08:34:53Z","snapshot_observed_at":"2026-08-07T22:10:57.570332Z","submitted_at":"2025-03-20T08:34:53Z","title":"From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.15944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15944","snapshot_observed_at":"2026-08-06T18:57:39.004702Z","title":"From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models","venue":"cs.CL","work_id":"14bc022c-e17d-4c7b-b9f5-5cd1e9cb7c7a","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.660108Z"},"links":{"cited_paper":"/paper/2503.15944","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:ea740463183051106620f29ca47286fd9af2cda0d4f50dd8f57a7428e1eabf8c","observation_id":"19eb0e03-baf4-4282-a5d3-d0a919c91fd5","resolution":{"observed_at":"2026-08-06T18:57:39.010637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.561184Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"2538f422-6308-4be5-84b6-6f1bb548b598","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.662982Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:68b7466df8d6ede7af8ace21a0b623486ef2de9716b9e700d8ae047f9931338d","observation_id":"6be53a0b-78aa-4601-aa1a-3b61d86d2755","resolution":{"observed_at":"2026-08-06T18:57:39.564114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.551335Z","title":"Reining generalization in offline reinforcement learning via representation distinction","venue":null,"work_id":"4f5f13e3-8bc5-4950-9155-2747aa12489e","year":2023},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.665803Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:3c897267b9d1bb29d14a9f5bba1643f8f9e91f1867348379929141a45edd01b1","observation_id":"bf3a4479-b0c9-4279-bdc4-58d442b206d5","resolution":{"observed_at":"2026-08-06T18:57:39.554466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.541741Z","title":"Iteratively refined behavior regularization for offline reinforcement learning","venue":null,"work_id":"89d047ef-3a76-4039-b9d2-1f7bdc623bba","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.668609Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:e7442be81aa1af8a97d7365843499e50ebbd711fcadffb13bde48f21bc394e25","observation_id":"b3aa58f0-4432-4700-8bd8-5d8c5fc0f2eb","resolution":{"observed_at":"2026-08-06T18:57:39.545040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.671166Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.671166Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:dd6feca69105c43e199814cca462f88990799593d2268ceffd63d5ff88ba1b67","observation_id":"4ade3e9f-5330-4261-b1b4-e77e1e4854aa","resolution":{"observed_at":"2026-08-06T18:57:38.671166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.526866Z","title":null,"venue":null,"work_id":"525f219f-5c0d-4690-a729-28e3b93923e7","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.673658Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:c8a3aa0a263eb7ab8c57e44d40a0b2fe15aa6b08319db26c1820f33020569cfc","observation_id":"f9a26ac5-95fb-4a62-b7a7-1b638571f434","resolution":{"observed_at":"2026-08-06T18:57:39.530203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.518311Z","title":"Cassandras","venue":null,"work_id":"a7aac142-46b1-4bc7-8ce7-baa69dd3e4bb","year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.676511Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:e91cfb6ad395695233a535422856256951b610fdb5cad374b0f0b621e702f743","observation_id":"e8d6d070-020a-4d9e-a63b-1ae8a827ee77","resolution":{"observed_at":"2026-08-06T18:57:39.521394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.509088Z","title":"Speq: Offline stabilization phases for efficient q-learning in high update-to-data ratio reinforcement learning","venue":null,"work_id":"509e7d8b-6565-4c55-b5b6-1263e5ec15be","year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.679047Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:a27263ac9b497890492151445a8e6ee0a72dae6c22efe77bf1d71dbb77b84214","observation_id":"9b7553c1-3787-4eb4-bf64-4a81543fe049","resolution":{"observed_at":"2026-08-06T18:57:39.512153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-07T16:54:46.428327Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-06T18:57:38.681554Z","title":"Tapered off-policy reinforce: Stable and efficient reinforcement learning for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.681554Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9eb5566c22e23635fc5043e94dffac3de1248053b16cc5edcf5b4563b66956b5","observation_id":"24c1ddbc-e70b-4886-9465-ec048c185c8d","resolution":{"observed_at":"2026-08-06T18:57:38.681554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.499677Z","title":"Jordan, and Philipp Moritz","venue":null,"work_id":"d6736722-ad55-4e56-98f4-d006a59cb37f","year":2015},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.684257Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:16deb4472573811cc25d336f2a21216b53656afbb20196b4aeca58a60b3be97a","observation_id":"4d11505c-4543-4ea3-adc5-2d9f491d471d","resolution":{"observed_at":"2026-08-06T18:57:39.502652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.490898Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":"019a3451-cc82-451e-973d-1291c91cb9f1","year":2016},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.687132Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:77b84c9dc787c13755a3fbe63a41e43a9c51e3518e7685596a91f6da0955ae0e","observation_id":"22f9bee0-732a-4bae-ae6d-42f6cb655df2","resolution":{"observed_at":"2026-08-06T18:57:39.493797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T18:57:38.689779Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.689779Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:f44996d73bb242fd05dd027c6ba82a641cc189eab944707b8d39084f84f2bd2a","observation_id":"dcffece2-cacf-4009-9d27-8f172a16c27c","resolution":{"observed_at":"2026-08-06T18:57:38.689779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.692293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.692293Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:01b88918e8a479c33494b990c6f3fca1ff97525a5b4888496ef7f3cbac2dff13","observation_id":"6d95310c-4341-4732-a79a-c1e3bcae33cd","resolution":{"observed_at":"2026-08-06T18:57:38.692293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:57:38.694929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.694929Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:8c2d7a32eac5d0f84e36517ae5076d9722df66caf21c25ca02160d5044d76341","observation_id":"5439f3bd-5b71-454b-9616-ee3804e18e7c","resolution":{"observed_at":"2026-08-06T18:57:38.694929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.481882Z","title":null,"venue":null,"work_id":"89cae9d5-32ab-4702-a748-cf4ea7944a85","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.697960Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:65b3b73105a2854f720a37b7694016e19802ca86b256f39da094582f2a45bf3d","observation_id":"08bf06f9-9683-4cc3-b47e-4cd2db8693cb","resolution":{"observed_at":"2026-08-06T18:57:39.485092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.700774Z","title":"Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.700774Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:f0a00b51af75ed68423b9d979e37b4738af41ed290f8f7b373916c7f539e2793","observation_id":"451cb349-4f0e-4ef1-9500-466989e44479","resolution":{"observed_at":"2026-08-06T18:57:38.700774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.472542Z","title":"Sutton and Andrew G","venue":null,"work_id":"e0b2d885-05e9-469b-a891-7175b107bcee","year":1998},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.703468Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9cbc4e5e202ed9316f796ba46502fa89061212a93f02665b0ef34868ffb900b1","observation_id":"fd9063f1-88c2-4cca-962d-8342577d4b07","resolution":{"observed_at":"2026-08-06T18:57:39.475642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19612","last_updated":"2025-03-28T18:02:54Z","snapshot_observed_at":"2026-08-07T16:38:29.815435Z","submitted_at":"2025-03-25T12:52:38Z","title":"RL-finetuning LLMs from on- and off-policy data with a single algorithm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19612","snapshot_observed_at":"2026-08-06T18:57:38.706318Z","title":"Rl-finetuning llms from on-and off-policy data with a single algorithm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.706318Z"},"links":{"cited_paper":"/paper/2503.19612","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4a253c9ec5f848b0107add78c097531592cdc0d6ffebfa962655ee3a66c5edbd","observation_id":"013e6b96-1d08-4581-a879-967f60f4dbef","resolution":{"observed_at":"2026-08-06T18:57:38.706318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.462658Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":"200a68da-ee79-430f-9a29-96244ee6bd94","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.709490Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:2f00b61577cb363ba5b85e9770b587ca0ca1ee338e72b83e2184756b3915166f","observation_id":"34a51081-e03b-4d3c-891b-ecf941f8de30","resolution":{"observed_at":"2026-08-06T18:57:39.465782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T18:57:38.712144Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.712144Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:622cc61a8bbf4e2dc51cf653ff57f52c451a45e60447369856f60019b7e14307","observation_id":"a646dfcc-7460-4a39-807b-28dd653aa209","resolution":{"observed_at":"2026-08-06T18:57:38.712144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.452765Z","title":"Truly proximal policy optimization","venue":null,"work_id":"d6366e07-5bfb-44da-9db8-82390f327dce","year":2019},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.714875Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:7c2ad1abe5e2add70eb7e3b9ce30495d03b12091d98e54d2359a82ad0cbe5f2b","observation_id":"36d7c104-2b2d-4e9b-a5a0-310b1a3e7b01","resolution":{"observed_at":"2026-08-06T18:57:39.456135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.443457Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"7d26bf96-d8f9-4e47-abf4-49db1904e776","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.717354Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:0ae3144e030142dae18ec504d73fcb2b3236f9f0445a99d1809c66e8c6c543ab","observation_id":"37f24888-f153-448b-8e6f-c7327f052b92","resolution":{"observed_at":"2026-08-06T18:57:39.446489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-06T18:57:38.720506Z","title":"Light-r1: Curriculum sft, DPO and RL for long COT from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.720506Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:f7b7b479ed983692b92aef9061507dd5fb8b5d7f34472ee18f056b5ee9ae1cce","observation_id":"f4d0928f-6f77-40d6-9eaf-e34070df6e62","resolution":{"observed_at":"2026-08-06T18:57:38.720506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-06T18:57:38.723557Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.723557Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:50dddbc3c23fe514759523831c0c351e5ede4cf1fdf4c88e021502f447c26d2b","observation_id":"5c9d34cd-b56e-4fc3-ba0e-28c5d0378d74","resolution":{"observed_at":"2026-08-06T18:57:38.723557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T18:57:38.726510Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.726510Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:1ebdd3d5369e45ab6c21a81c18408e7a7b871302ab5975e4163f7470b912ff87","observation_id":"28f9f242-705e-4d1b-8ae8-cc19763f253b","resolution":{"observed_at":"2026-08-06T18:57:38.726510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-08-09T17:57:00.989532Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-08-06T18:57:38.729636Z","title":"Reasonflux: Hierarchical llm reasoning via scaling thought templates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.729636Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:a01eae989aa12856262d8317d0a8ef135e582d7316fd5df166a65f634b7682ff","observation_id":"1bd9843a-1ad8-4571-9604-2100e99d3afc","resolution":{"observed_at":"2026-08-06T18:57:38.729636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.434094Z","title":"Star: Self-taught reasoner bootstrapping reasoning with reasoning","venue":null,"work_id":"57233316-a314-4378-aa04-11433466ab35","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.732780Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:0c202f43735fbead29a1c0452d7c501275a23f719f757f8338e3ebc375698d10","observation_id":"7ea91d13-5412-42af-b37b-2f39d9ddb1de","resolution":{"observed_at":"2026-08-06T18:57:39.437299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.423957Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":"31d8bbfe-f2d5-478c-99ec-3ea08f9a43e7","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.735478Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:6fd2b24871b1ff186ce8a646930176e9c12f1336094dac58108d9aed6d461356","observation_id":"67976d1d-e23a-47ed-b422-8588f9368580","resolution":{"observed_at":"2026-08-06T18:57:39.427422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-07T15:42:59.701048Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-06T18:57:38.738111Z","title":"Adaptthink: Reasoning models can learn when to think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.738111Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:64eae77e06c70a2190204e64307f36772d63e72a3f389e70f334aac0cb22d793","observation_id":"5bd67773-33ef-40e1-8585-8922dcb3f4fd","resolution":{"observed_at":"2026-08-06T18:57:38.738111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:28:23.029343Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 13 inbound Pith citation observations for arXiv:2507.06892."}