Pith. sign in

Paper Citation Record · LEDGER

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

As of 7 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 13 inbound Pith citation observations for arXiv:2507.06892.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.06892 v3

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:57:38.738111Z

measured 73 of 73 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 13 of 13 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T04:39:03.382391Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T08:09:40.703268Z

Reference resolution

60 of 60 outbound references displayed

  • verified exact1
  • verified fuzzy25
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2610c449-92c3-4237-b68f-837cb95d3efd · outbound

This paper cites Courville, and Marc G.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Courville, and Marc G

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.685294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.569907Z digest=sha256:a7670cab7e376814fcc9fc3649aec217f0ebf4d1da777a1ed19cb8b429dd466a

Observation c77a04f0-b335-4aca-835e-cf99a9b82da2 · outbound

This paper cites L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.573983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.573983Z digest=sha256:6f5ea909345db3fde327729016d12d4204b4bc964389b9a0351644f466538438

Observation 2cb985f7-c2bf-461d-b3b7-ddd22a85de4a · outbound

This paper cites Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.676627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.577490Z digest=sha256:a3e5fa63cea22320457df76639d6460a9350a44ab32517f7d8398c44bcfa1b73

Observation 80e48911-6d5a-4f96-b991-58bd963bb06b · outbound

This paper cites Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.580390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.580390Z digest=sha256:8b4dcfc111cc856d385d87e0518854ff2d018b62bb5b74cd3bad762abbd32bb6

Observation 4ad64ff2-e8d6-4a4e-8250-b65159d4fdfd · outbound

This paper cites Asymmetric reinforce for off-policy reinforcement learning: Balancing positive and negative rewards.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Asymmetric reinforce for off-policy reinforcement learning: Balancing positive and negative rewards

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.583323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.583323Z digest=sha256:4c504d2a576df940089e91ccaf57e02add4022320685cd014d403364c3fe5c41

Observation 9f0eee0b-866b-48b0-bc3d-b6799b1b46d5 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.586349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.586349Z digest=sha256:9ca2e78799508a53b708e790cd2b9839c79ecf69ad43427b0ebeb535773c78bc

Observation c988a462-281d-4c88-acf0-f800fc8c8105 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Constitutional AI: Harmlessness from AI Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.589705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.589705Z digest=sha256:85e76b5211d1e1e5e5b279541a4b751a8899f2d6e671600ed9a0087c4e42acae

Observation dfd95391-ebaf-41cc-ac93-6aefd7da941e · outbound

This paper cites Randomized ensembled double q-learning: Learning fast without a model.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Randomized ensembled double q-learning: Learning fast without a model

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.661204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.592847Z digest=sha256:608558dcb4704d92f64dad766cc2e27771a433cbdad54b4f526776623a1b9f9c

Observation 162c4416-8a67-4ce8-9d07-a7313e31f590 · outbound

This paper cites AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.595495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.595495Z digest=sha256:fb103b2ae7562104a0e9beab19f057107d85fb087f9bdf8fd101439fb584d603

Observation 2ea8bd9b-b671-4073-ae7e-c9bc97ee0670 · outbound

This paper cites Soft Policy Optimization: Online Off-Policy RL for Sequence Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Soft Policy Optimization: Online Off-Policy RL for Sequence Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.598767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.598767Z digest=sha256:42d0ffa0eaeb973bbc1b2727786a78684d15f841b371fe1729edcb8c0db229a6

Observation 70a7c6b4-3295-4808-be17-964e2c5f0e00 · outbound

This paper cites Reinforcement learning for reasoning in small llms: What works and what doesn't.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Reinforcement learning for reasoning in small llms: What works and what doesn't

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.601641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.601641Z digest=sha256:9a077865fb6f48f1fc9696e4e658d377e6aae4a54a8b2d85ee85fbceeb904f40

Observation 393233f6-6531-4951-acab-e6f7ab0deac5 · outbound

This paper cites IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.651742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.604364Z digest=sha256:301bdcf5d9fa53a62025595d94818f1069f4e230485bf85cd84a4d12d97e1f74

Observation 16e72a72-22cd-4a63-95f9-04c69ebf38df · outbound

This paper cites Concise reasoning via reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Concise reasoning via reinforcement learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.607005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.607005Z digest=sha256:b7242e6da3da2c58fa245c0b29f2f280ca65034ed7ec3abd40f1ed9fc3676784

Observation ed5e93d1-783f-4001-ad8c-aa6e1b1e5aa8 · outbound

This paper cites Fujimoto, H.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Fujimoto, H

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.642671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.609444Z digest=sha256:bb362582732bc388bc8fdaed6fe56052ce00ce02b09838872e66e99bed180d32

Observation a900bc4e-07ba-4cc7-83f7-964739ef6ac6 · outbound

This paper cites Omni-math: A universal olympiad level mathematic benchmark for large language models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Omni-math: A universal olympiad level mathematic benchmark for large language models

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.633868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.612270Z digest=sha256:8711afa435e36ff9b50394e5dd0555aefef407c9d13019692f351726e53c16db

Observation 70b85926-1f13-48d4-84d2-16cf5324ca0b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.614872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.614872Z digest=sha256:649cb078f998073d2023f26bd4bbc5ad1a5a28fa60059b07960a1065f97a5c0f

Observation be9c56bf-41f2-45f6-b4da-2a02afdfffcb · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.624855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.617608Z digest=sha256:59534694d5929327c5560cfb6f855b8905b7533f15f2bd1f75dc10060212b746

Observation 12e65803-a1fd-4ef8-a8de-6ab262a11134 · outbound

This paper cites O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.615595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.621112Z digest=sha256:f1ada5297e347703c2f116347d2f998f4d315d08f6d2aeda882da2d284ebe127

Observation eac0ca50-77da-4c6d-b617-3f70d76a2fe7 · outbound

This paper cites Skywork Open Reasoner 1 Technical Report.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Skywork Open Reasoner 1 Technical Report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.623857Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.623857Z digest=sha256:d1a14f6572daff60939114fe74c48bbac241aac78d526150548976103688ef3b

Observation 04b5bf4b-de32-4e61-97f0-9d47fd639b78 · outbound

This paper cites Measuring mathematical problem solving with the MATH dataset.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Measuring mathematical problem solving with the MATH dataset

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.626666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.626666Z digest=sha256:640bca08640acab58482b2ecd8a963f1e25e133b118be4484c2703f98b7b3888

Observation 3328c8a4-0c39-45d6-89c0-85eb10fc3582 · outbound

This paper cites Rainbow: Combining improvements in deep reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Rainbow: Combining improvements in deep reinforcement learning

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.600557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.629274Z digest=sha256:8877fa8c315d8ab5280ceaad06481b3845fa499b78321e5f7b10c2490423a74e

Observation a378b549-95f8-4ce0-962c-75f61d17b505 · outbound

This paper cites Dropout Q-Functions for Doubly Efficient Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Dropout Q-Functions for Doubly Efficient Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.631941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.631941Z digest=sha256:360cb15b7f3d6ad59c0dcb85d1067c974c7a7130c23d1344ce09536d413488ef

Observation 7cfd7d7e-9d71-4916-8f80-8d1013ceb891 · outbound

This paper cites Ii-thought.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Ii-thought

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.591562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.634606Z digest=sha256:b07d1f847a6b6e3df192c622a78e102dd2ce60d216d4dea71b84dbe24830fd76

Observation 683bc374-3d9e-40c1-aa52-0171f9784ca8 · outbound

This paper cites OpenAI o1 System Card.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model OpenAI o1 System Card

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.637134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.637134Z digest=sha256:fc2fbc0bdcfebb9699e9eb114b27f536c34c371ebf8a49e9d8f75ad1f5f10ca2

Observation 354f7b51-4215-4f86-b33f-d8765cb4fac0 · outbound

This paper cites Towards Mitigating Hallucination in Large Language Models via Self-Reflection.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Towards Mitigating Hallucination in Large Language Models via Self-Reflection

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.639909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.639909Z digest=sha256:40359be6a162a59eb07bc22174dc095aca32480f347154b1acf34ae480c879dc

Observation 381f4a2a-5caf-4152-a782-427d95387ff5 · outbound

This paper cites Kakade and John Langford.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Kakade and John Langford

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.582131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.643545Z digest=sha256:0ef37097d3266cf3931db4d1bf1dba4e23e989d8fa641623d5f8fa7468ee388e

Observation cd2317f9-283c-4d90-addd-5786421cb595 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.646294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.646294Z digest=sha256:199f145a661c6cbb84508d1fa8ae136ec51cce04742b38d732efdf7d46ae81ef

Observation 5c9e9e1f-94cb-4ccc-8aab-1cf469a1c64d · outbound

This paper cites Solving quantitative reasoning problems with language models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Solving quantitative reasoning problems with language models

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.573429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.649173Z digest=sha256:742d13ff3dac2509e12292969f12a8a9941ed0bb5783f9995b1affc188bb757a

Observation 9a63b81c-201f-4b0c-8e2b-08465d99b10d · outbound

This paper cites RePO: Replay-Enhanced Policy Optimization.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model RePO: Replay-Enhanced Policy Optimization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.651814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.651814Z digest=sha256:6c27f36671ccf70f2e462f9e15ae56c39ba08b5ea1fc672b60bf3328239d919a

Observation 1ef5b0fc-e36b-4d2a-89a9-c32b6b72ce9c · outbound

This paper cites From System 1 to System 2: A Survey of Reasoning Large Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model From System 1 to System 2: A Survey of Reasoning Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.654774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.654774Z digest=sha256:912d25a713e202b5e923dd8620e707ebf047cd9ac25f478ced42e7ee278d04b4

Observation 77054f07-b2a7-4362-8750-e8324c27da23 · outbound

This paper cites Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.657416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.657416Z digest=sha256:8d24271407f50704a20a0db80cdfc81af802d20500f100b65582225051713731

Observation 19eb0e03-baf4-4282-a5d3-d0a919c91fd5 · outbound

This paper cites From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:57:39.010637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.660108Z digest=sha256:0c9d0eb917874a7e4d491207318113ca321acc53e1ed267131b1f4fd6759bdff

Observation 6be53a0b-78aa-4601-aa1a-3b61d86d2755 · outbound

This paper cites Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.564114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.662982Z digest=sha256:6517b987f3973578ba3b9be31d236317f68040cedeeb319e5467b479e70502ac

Observation bf3a4479-b0c9-4279-bdc4-58d442b206d5 · outbound

This paper cites Reining generalization in offline reinforcement learning via representation distinction.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Reining generalization in offline reinforcement learning via representation distinction

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.554466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.665803Z digest=sha256:3a8e6d23c22d03f35527fc75904b88487d9713f4229acc716b65250421a94de0

Observation b3aa58f0-4432-4700-8bd8-5d8c5fc0f2eb · outbound

This paper cites Iteratively refined behavior regularization for offline reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Iteratively refined behavior regularization for offline reinforcement learning

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.545040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.668609Z digest=sha256:035f7ca5cdc3ed49eb8e1443fee786f0eaa4dd2c5fa945209f6bf38537218202

Observation 4ade3e9f-5330-4261-b1b4-e77e1e4854aa · outbound

This paper cites Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.671166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.671166Z digest=sha256:11df8e04b75f00ad222696cd7191eea6d79cd1c51bdff03f9dc0cf8609884eb9

Observation f9a26ac5-95fb-4a62-b7a7-1b638571f434 · outbound

This paper cites an unresolved cited work.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Unresolved cited work

Reference 37

Resolution
unresolved
raw_fallback, observed 2026-08-06T18:57:39.530203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.673658Z digest=sha256:0de18538f797d7c95fe6802c72c360f0dbbabf63db9800894707f0e2ceaaa151

Observation e8d6d070-020a-4d9e-a63b-1ae8a827ee77 · outbound

This paper cites Cassandras.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Cassandras

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.521394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.676511Z digest=sha256:3352fb4fe317466997a44e1284bb2dbf6d40e2e597cdc25876097576552de854

Observation 9b7553c1-3787-4eb4-bf64-4a81543fe049 · outbound

This paper cites Speq: Offline stabilization phases for efficient q-learning in high update-to-data ratio reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Speq: Offline stabilization phases for efficient q-learning in high update-to-data ratio reinforcement learning

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.512153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.679047Z digest=sha256:fec9c7ae8ebacc68ca0896a9b9bf6e8fd8360becc0042525651dfea9b1209cf0

Observation 24c1ddbc-e70b-4886-9465-ec048c185c8d · outbound

This paper cites Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.681554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.681554Z digest=sha256:c734d08f5283e9c7ed6120e5027a170d3fdc3152e39ca28b5bc6cc2420ae908e

Observation 4d11505c-4543-4ea3-adc5-2d9f491d471d · outbound

This paper cites Jordan, and Philipp Moritz.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Jordan, and Philipp Moritz

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.502652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.684257Z digest=sha256:7f17f2b5a4f2ed69a09666c05877e4046cd2b5e6e144135dd2cf635760db4503

Observation 22f9bee0-732a-4bae-ae6d-42f6cb655df2 · outbound

This paper cites Jordan, and Pieter Abbeel.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Jordan, and Pieter Abbeel

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.493797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.687132Z digest=sha256:fe128b48e0c2f603a51e31e5f8aa8d2d5bd96600e02b3ebe850fc9f62cf411d5

Observation dcffece2-cacf-4009-9d27-8f172a16c27c · outbound

This paper cites Proximal Policy Optimization Algorithms.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Proximal Policy Optimization Algorithms

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.689779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.689779Z digest=sha256:cd54f104a00e3e991346dbab0d895879af2bfb148f0598964119841e9deaea00

Observation 6d95310c-4341-4732-a79a-c1e3bcae33cd · outbound

This paper cites an unresolved cited work.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Unresolved cited work

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.692293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.692293Z digest=sha256:5a3c9cae9df0706071a9ec85449b8570d5cd9af234dbf899bd9a3714e6c5c678

Observation 5439f3bd-5b71-454b-9616-ee3804e18e7c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.694929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.694929Z digest=sha256:f284343cd8d4ec2aea5110c39c661e7e47008de502c2c060e8aecb585e1ff87c

Observation 08bf06f9-9683-4cc3-b47e-4cd2db8693cb · outbound

This paper cites an unresolved cited work.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-06T18:57:39.485092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.697960Z digest=sha256:77f3c18ca1f0f2d92e140a770b29b6407d4d7188b2b216027b0b2fc64d16faad

Observation 451cb349-4f0e-4ef1-9500-466989e44479 · outbound

This paper cites Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.700774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.700774Z digest=sha256:d781632bd2e975bb35ea0e2d69e6dafb57021db7eee471d715132122b2cd6690

Observation fd9063f1-88c2-4cca-962d-8342577d4b07 · outbound

This paper cites Sutton and Andrew G.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Sutton and Andrew G

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.475642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.703468Z digest=sha256:7e2cef8490e591bd8c85ece80063a89680e20a5c83cb2b0c820aa01d435ae30d

Observation 013e6b96-1d08-4581-a879-967f60f4dbef · outbound

This paper cites RL-finetuning LLMs from on- and off-policy data with a single algorithm.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model RL-finetuning LLMs from on- and off-policy data with a single algorithm

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.706318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.706318Z digest=sha256:87c6cba18df13fead48df672d049890f13446de939211d9e16b4b3ea529bfd28

Observation 34a51081-e03b-4d3c-891b-ecf941f8de30 · outbound

This paper cites Reft: Reasoning with reinforced fine-tuning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Reft: Reasoning with reinforced fine-tuning

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.465782Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.709490Z digest=sha256:b21d526c2e45b753c631d8f73a2a938253cc4751b819582b1ccc1e3256058256

Observation a646dfcc-7460-4a39-807b-28dd653aa209 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.712144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.712144Z digest=sha256:fc5bbc171d32d3f40a41022695a4ca8bcd6a0a4a322e2a7d9c8a75e4d6b4569b

Observation 36d7c104-2b2d-4e9b-a5a0-310b1a3e7b01 · outbound

This paper cites Truly proximal policy optimization.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Truly proximal policy optimization

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.456135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.714875Z digest=sha256:96085864f39395d01318b7fa83993af0f369cb6c213edd222da35cf73e3f29ba

Observation 37f24888-f153-448b-8e6f-c7327f052b92 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Chain-of-thought prompting elicits reasoning in large language models

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.446489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.717354Z digest=sha256:8a93d20eb2ab3105327b121e3097647c38bdbc9a644de208b8766df7c9e1026a

Observation f4d0928f-6f77-40d6-9eaf-e34070df6e62 · outbound

This paper cites Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.720506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.720506Z digest=sha256:0914c69771b80171b216387bd8d8744bdea07dc776d0148a740bfdad4d2fd5fd

Observation 5c9d34cd-b56e-4fc3-ba0e-28c5d0378d74 · outbound

This paper cites Learning to Reason under Off-Policy Guidance.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Learning to Reason under Off-Policy Guidance

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.723557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.723557Z digest=sha256:09240778e12753ac6dc03f80b158608aaef3c3eaf6eee44472bb40a01218a3c2

Observation 28f9f242-705e-4d1b-8ae8-cc19763f253b · outbound

This paper cites Qwen3 Technical Report.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Qwen3 Technical Report

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.726510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.726510Z digest=sha256:aa77430728488e3d32fe7fc7686cc34bb12d89bd40d28d851889ad18fcb0f832

Observation 1bd9843a-1ad8-4571-9604-2100e99d3afc · outbound

This paper cites ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.729636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.729636Z digest=sha256:ab677d604022df0117718b3880450b44b04e69b47d0dbc6c17e691e4af861176

Observation 7ea91d13-5412-42af-b37b-2f39d9ddb1de · outbound

This paper cites Star: Self-taught reasoner bootstrapping reasoning with reasoning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Star: Self-taught reasoner bootstrapping reasoning with reasoning

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.437299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.732780Z digest=sha256:e910218a313f775b1f394fc2ad2651e81d34d8fbb7b440b3e5aa226e12ec14e5

Observation 67976d1d-e23a-47ed-b422-8588f9368580 · outbound

This paper cites Rest-mcts*: Llm self-training via process reward guided tree search.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Rest-mcts*: Llm self-training via process reward guided tree search

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.427422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.735478Z digest=sha256:e4de1bf60b7728c19ccce3d517805f703ecef32b08f404260de088666cd8702c

Observation 5bd67773-33ef-40e1-8585-8922dcb3f4fd · outbound

This paper cites AdaptThink: Reasoning Models Can Learn When to Think.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model AdaptThink: Reasoning Models Can Learn When to Think

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.738111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.738111Z digest=sha256:ebd465f7231c995e358f71ac345bff200d56740cc58b9c6f5d0d4a90a50a32ac

Pith citing papers

Observation 56a88053-8484-4f20-8e2e-d2afacf86fab · inbound

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies cites this paper.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.382391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.382391Z digest=sha256:9455679becd6775415613ff1103df76147f2e7bafcc24dff52b888b4f012f910

Observation f55dcc61-54c0-42e7-b913-376652390503 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 298

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:24.819691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:dd27b9ce450fe58f31231052355b020a15981303596f536f177f60777fa5f6f4

Observation 70c6515c-dc0f-448b-9b73-832627027942 · inbound

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models cites this paper.

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T16:48:02.883638Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T16:46:30.674244Z digest=sha256:1aa096a7451529c9aad3990a3e25471d85d90a8f283c1ed6b22e0dac5bdf8621

Observation 387033bb-6cb1-4f23-9b62-1a342820f39f · inbound

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space cites this paper.

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:41:04.087868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-10T12:50:57.603403Z digest=sha256:642782b5982c8112bd2a406aa59a01f0870ee01986a4b160db49ce705ff2f1c6

Observation b66fa036-e05a-4695-81bc-fef0a840ab7d · inbound

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning cites this paper.

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:56:13.385814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-10T04:29:21.897215Z digest=sha256:423a0959f8f5687f3db718cc881bedef3dd21b59629858deb71d0710fce6fa6b

Observation 6b03ad2d-f6af-45dc-92fa-3ad994e68e0a · inbound

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning cites this paper.

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 73

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:15:49.306961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-10T19:15:27.406778Z digest=sha256:d06c88ec71f03fc4941af05711eb6d8b28ac84339ccb461b1036c387bb1538f1

Observation 92c5b202-9bfe-4c5c-b64a-08617c072a60 · inbound

Learning Agentic Policy from Action Guidance cites this paper.

Learning Agentic Policy from Action Guidance Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:07:17.618672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T05:02:49.206053Z digest=sha256:57ecb8d0237b0f19f3ebb74b8a9b1b104c87c13f619e2b03d6ebd9a62a7da739

Observation 1d775364-fee8-466c-b897-6c43696ec376 · inbound

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning cites this paper.

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-01T21:16:13.350886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-28T17:25:50.758630Z digest=sha256:d78148ebb935ce65112840c95db2dae03c7b8ea470b5649c54d81831a2842d9c

Observation 8710f2d7-6436-4e9b-b31c-6062714716a8 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 112

Resolution
verified exact
arxiv_id, observed 2026-07-04T08:09:40.704821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:9b00d2b37c3092a8a48217fcbc2d3f0939afb7d9f82159b541cbde3b2597f300

Observation 894710be-2893-4b06-bcb2-48495fcf0ba9 · inbound

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents cites this paper.

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-11T14:43:39.668059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T14:43:39.668059Z digest=sha256:1834715b5705650aec0fd6830a78b5dff14f42e2b6ab64c2bc43c5f6cb67ea7a

Observation 4830619b-67bb-4586-920e-a111b79b15f6 · inbound

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples cites this paper.

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 50

Resolution
unresolved
no resolver link, observed 2026-07-14T11:23:30.063231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-14T11:23:30.063231Z digest=sha256:ff666244b17a37e79d00e0262087c11d62fedd7f1dbe27d23a68eebdace9f9c6

Observation a6ba5694-badf-4fad-8793-20ff8e40f96b · inbound

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples cites this paper.

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T07:23:28.818300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T07:23:28.818300Z digest=sha256:784d8a578a590964d790e054ed5a924029715f401477b89c7747c35e6641e96f

Observation f8a5b6de-1ab0-41b3-90ec-3cb6462a186e · inbound

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information cites this paper.

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T12:54:27.855935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T12:54:27.855935Z digest=sha256:23fc5e98c695b583ca6fb2e9b303372a0bfe685bd0fbc68ce3e9f81da340c181