Pith. sign in

Paper Citation Record · LEDGER

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 13 inbound Pith citation observations for arXiv:2507.06892.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.06892 v3

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:57:38.738111Z

measured 73 of 73 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 13 of 13 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T04:39:03.382391Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T08:09:40.703268Z

Reference resolution

60 of 60 outbound references displayed

  • verified exact1
  • verified fuzzy25
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2610c449-92c3-4237-b68f-837cb95d3efd · outbound

This paper cites Courville, and Marc G.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Courville, and Marc G

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.685294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.569907Z digest=sha256:9aedab5cec90c52f7674bae59923da7ae92bba3bc19cdb7a1d8de6ca7659adf5

Observation c77a04f0-b335-4aca-835e-cf99a9b82da2 · outbound

This paper cites L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.573983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.573983Z digest=sha256:75cc3f212fc2facb760a736f6327efa6c6948a9e66bb498cb9464dbcdd1fff4f

Observation 2cb985f7-c2bf-461d-b3b7-ddd22a85de4a · outbound

This paper cites Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.676627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.577490Z digest=sha256:31004562d0c31f6c1f312d4600879fa76370c437e5d29f67b1ee3c6ea107a5f1

Observation 80e48911-6d5a-4f96-b991-58bd963bb06b · outbound

This paper cites Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.580390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.580390Z digest=sha256:8b55486c3c3560dd51b11f503d85f9d7c821fd5271c0f05102d9ccdeab9b7610

Observation 4ad64ff2-e8d6-4a4e-8250-b65159d4fdfd · outbound

This paper cites Asymmetric reinforce for off-policy reinforcement learning: Balancing positive and negative rewards.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Asymmetric reinforce for off-policy reinforcement learning: Balancing positive and negative rewards

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.583323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.583323Z digest=sha256:84c676959d95e415dcbb76a546b94c242e8b2f03734510760a99840932ebc7b0

Observation 9f0eee0b-866b-48b0-bc3d-b6799b1b46d5 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.586349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.586349Z digest=sha256:0436eb6010b5b35b27b90d7ea91ffd7eb9dd51186d81157f66a22fddc20d6e27

Observation c988a462-281d-4c88-acf0-f800fc8c8105 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Constitutional AI: Harmlessness from AI Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.589705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.589705Z digest=sha256:da8d0df4d0721f5709ed0da15f80140aa2ce7403201c034e045203c53dcf7122

Observation dfd95391-ebaf-41cc-ac93-6aefd7da941e · outbound

This paper cites Randomized ensembled double q-learning: Learning fast without a model.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Randomized ensembled double q-learning: Learning fast without a model

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.661204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.592847Z digest=sha256:b4025bb4999013259c7a242753fe717a793f38f3118d279079af0393bd7010c0

Observation 162c4416-8a67-4ce8-9d07-a7313e31f590 · outbound

This paper cites AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.595495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.595495Z digest=sha256:d889293135dfa3fe44ff07143f8c2aeceb871b568dd051398e3ed1c9171adaad

Observation 2ea8bd9b-b671-4073-ae7e-c9bc97ee0670 · outbound

This paper cites Soft Policy Optimization: Online Off-Policy RL for Sequence Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Soft Policy Optimization: Online Off-Policy RL for Sequence Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.598767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.598767Z digest=sha256:d23a36f1e365a1e0b7afc0d69ed16540550e9be343f0508095904f25ca71fa45

Observation 70a7c6b4-3295-4808-be17-964e2c5f0e00 · outbound

This paper cites Reinforcement learning for reasoning in small llms: What works and what doesn't.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Reinforcement learning for reasoning in small llms: What works and what doesn't

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.601641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.601641Z digest=sha256:4b7064375f5f6e6d98301d84e255bb11f536b4c8c622bbdf752f2478afac193b

Observation 393233f6-6531-4951-acab-e6f7ab0deac5 · outbound

This paper cites IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.651742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.604364Z digest=sha256:d7427a7cf514e4ee108957fbd3e94059229089fa60bacbe2b63ae1e069591c9f

Observation 16e72a72-22cd-4a63-95f9-04c69ebf38df · outbound

This paper cites Concise reasoning via reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Concise reasoning via reinforcement learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.607005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.607005Z digest=sha256:c942bce15dede541dac5a961fc772546a57b4b5b6e78abb231c850134f976139

Observation ed5e93d1-783f-4001-ad8c-aa6e1b1e5aa8 · outbound

This paper cites Fujimoto, H.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Fujimoto, H

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.642671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.609444Z digest=sha256:cd2aac2205d82e9be4a13dc2c247d99663141d609bb43ae9b51582eeb920ad90

Observation a900bc4e-07ba-4cc7-83f7-964739ef6ac6 · outbound

This paper cites Omni-math: A universal olympiad level mathematic benchmark for large language models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Omni-math: A universal olympiad level mathematic benchmark for large language models

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.633868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.612270Z digest=sha256:684bfbc190fe585faf757d56e5635eaa136ceaae2ebae75b0bc4adb34ebad6a0

Observation 70b85926-1f13-48d4-84d2-16cf5324ca0b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.614872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.614872Z digest=sha256:61296c142e5494db758653fd09596fdc8455bedc39c20c7f90c815f357db233e

Observation be9c56bf-41f2-45f6-b4da-2a02afdfffcb · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.624855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.617608Z digest=sha256:9ff8d5a9b6dcd646efc5ab5b3ca2031d641a614aa3863532f6f15d9a679f31df

Observation 12e65803-a1fd-4ef8-a8de-6ab262a11134 · outbound

This paper cites O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.615595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.621112Z digest=sha256:65f1eff1e67591e611cbf9aa88b35df12caf3f9337c68b550b51cd5d1f9d71d2

Observation eac0ca50-77da-4c6d-b617-3f70d76a2fe7 · outbound

This paper cites Skywork Open Reasoner 1 Technical Report.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Skywork Open Reasoner 1 Technical Report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.623857Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.623857Z digest=sha256:577d95cbf20af4929275047c1f2f2f9923b4a8d4fa12e962a97d899e6a3bafe2

Observation 04b5bf4b-de32-4e61-97f0-9d47fd639b78 · outbound

This paper cites Measuring mathematical problem solving with the MATH dataset.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Measuring mathematical problem solving with the MATH dataset

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.626666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.626666Z digest=sha256:af41f37c6f22a4d7445f3622ea0fa07c323c73fc5fdfbc9d69886890cfff9bb1

Observation 3328c8a4-0c39-45d6-89c0-85eb10fc3582 · outbound

This paper cites Rainbow: Combining improvements in deep reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Rainbow: Combining improvements in deep reinforcement learning

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.600557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.629274Z digest=sha256:c726b0beb73098846cf897782efab91cc18c7a85f8c15aff8279a86ce2367253

Observation a378b549-95f8-4ce0-962c-75f61d17b505 · outbound

This paper cites Dropout Q-Functions for Doubly Efficient Reinforcement Learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Dropout Q-Functions for Doubly Efficient Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.631941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.631941Z digest=sha256:17d80bfc9497d158e70a48cb27a68f9e83a4f742c3b44643de3c0398faffcce7

Observation 7cfd7d7e-9d71-4916-8f80-8d1013ceb891 · outbound

This paper cites Ii-thought.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Ii-thought

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.591562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.634606Z digest=sha256:07a8abf69d30db2c31acba96ff05cde1bb53119e8f679165b3c3fbd6a2414e02

Observation 683bc374-3d9e-40c1-aa52-0171f9784ca8 · outbound

This paper cites OpenAI o1 System Card.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model OpenAI o1 System Card

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.637134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.637134Z digest=sha256:4d7577f45973a2660f78b64d29e3776b485ec58381c4d3d1a148223dc7072340

Observation 354f7b51-4215-4f86-b33f-d8765cb4fac0 · outbound

This paper cites Towards Mitigating Hallucination in Large Language Models via Self-Reflection.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Towards Mitigating Hallucination in Large Language Models via Self-Reflection

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.639909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.639909Z digest=sha256:e2a78816f2383a8f16e6bc0e27ffd45c61ca712cc137f668f0715b65a168e605

Observation 381f4a2a-5caf-4152-a782-427d95387ff5 · outbound

This paper cites Kakade and John Langford.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Kakade and John Langford

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.582131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.643545Z digest=sha256:4907aaa9ee415a20849448f65455c2fe7083f33316736b997c3fc3c55bb2fa9f

Observation cd2317f9-283c-4d90-addd-5786421cb595 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.646294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.646294Z digest=sha256:b3943cc1f1d7435100bc48d5f19773aa33e4f73e3dd84914c21be778ce7b6722

Observation 5c9e9e1f-94cb-4ccc-8aab-1cf469a1c64d · outbound

This paper cites Solving quantitative reasoning problems with language models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Solving quantitative reasoning problems with language models

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.573429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.649173Z digest=sha256:ad5fcf04b29b4f26407d2f85364ab463769ee5816408ec5fbbc91855036f7d6a

Observation 9a63b81c-201f-4b0c-8e2b-08465d99b10d · outbound

This paper cites RePO: Replay-Enhanced Policy Optimization.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model RePO: Replay-Enhanced Policy Optimization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.651814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.651814Z digest=sha256:8e5e0d2d641f78a404b50835c6ddd7d0cdb719fdb0ea638c2922088b5eca62cd

Observation 1ef5b0fc-e36b-4d2a-89a9-c32b6b72ce9c · outbound

This paper cites From System 1 to System 2: A Survey of Reasoning Large Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model From System 1 to System 2: A Survey of Reasoning Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.654774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.654774Z digest=sha256:feafd8d7b019d86497fb3065a5465881553cb7b53de448ccaca7f3f0b1183fcc

Observation 77054f07-b2a7-4362-8750-e8324c27da23 · outbound

This paper cites Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.657416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.657416Z digest=sha256:c3a10a0e495ecbf99cc8306af928f94a25b96631ba322cb67a504d5be2158474

Observation 19eb0e03-baf4-4282-a5d3-d0a919c91fd5 · outbound

This paper cites From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:57:39.010637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.660108Z digest=sha256:0e12a74d95665bc17985f893967ddad67aa60edcd9c4b85059555734cd452f7e

Observation 6be53a0b-78aa-4601-aa1a-3b61d86d2755 · outbound

This paper cites Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.564114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.662982Z digest=sha256:88c78e84c420a72e19cc979c63483bf05b9743a378eb7953c8922aaf5b2f4970

Observation bf3a4479-b0c9-4279-bdc4-58d442b206d5 · outbound

This paper cites Reining generalization in offline reinforcement learning via representation distinction.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Reining generalization in offline reinforcement learning via representation distinction

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.554466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.665803Z digest=sha256:f3b491a9678bca3bafbcbc1d4ce297f10cb8ed397802d97816b657b4c3434f57

Observation b3aa58f0-4432-4700-8bd8-5d8c5fc0f2eb · outbound

This paper cites Iteratively refined behavior regularization for offline reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Iteratively refined behavior regularization for offline reinforcement learning

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.545040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.668609Z digest=sha256:0cf549b1cb54c6ec58f08d636836503bb79763d2c4b14a2a08efae6a3b20c2df

Observation 4ade3e9f-5330-4261-b1b4-e77e1e4854aa · outbound

This paper cites Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.671166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.671166Z digest=sha256:336f440c82114b8843855b1fd2443ee3bcde987fa4aff13e9c514d35e52304ec

Observation f9a26ac5-95fb-4a62-b7a7-1b638571f434 · outbound

This paper cites an unresolved cited work.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Unresolved cited work

Reference 37

Resolution
unresolved
raw_fallback, observed 2026-08-06T18:57:39.530203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.673658Z digest=sha256:dcd310cabe6c3a2c1e5de2e86770dfc83619f381df4bcab586d7626eb8d0fdeb

Observation e8d6d070-020a-4d9e-a63b-1ae8a827ee77 · outbound

This paper cites Cassandras.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Cassandras

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.521394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.676511Z digest=sha256:1b094952577babac38d16d45067574cd1a502bf58a994821ce727d775ee85da5

Observation 9b7553c1-3787-4eb4-bf64-4a81543fe049 · outbound

This paper cites Speq: Offline stabilization phases for efficient q-learning in high update-to-data ratio reinforcement learning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Speq: Offline stabilization phases for efficient q-learning in high update-to-data ratio reinforcement learning

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.512153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.679047Z digest=sha256:3c31406209a60bea0ea9045ec6384a3087155fcffcfd02f0f4ce7ae8e2b86f9b

Observation 24c1ddbc-e70b-4886-9465-ec048c185c8d · outbound

This paper cites Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.681554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.681554Z digest=sha256:3a964f801953e45103db8d43d6858a87b1a8389214e6d44a81e5183290a5d7a4

Observation 4d11505c-4543-4ea3-adc5-2d9f491d471d · outbound

This paper cites Jordan, and Philipp Moritz.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Jordan, and Philipp Moritz

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.502652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.684257Z digest=sha256:b30c34a701fe31440e8448ff3a98f99e56fbfc57568dacce987404a1026533d9

Observation 22f9bee0-732a-4bae-ae6d-42f6cb655df2 · outbound

This paper cites Jordan, and Pieter Abbeel.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Jordan, and Pieter Abbeel

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.493797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.687132Z digest=sha256:27f9ab222f31456a8d6553e7da0bd9003473b6cfe7656f6e56db8b245ce68da7

Observation dcffece2-cacf-4009-9d27-8f172a16c27c · outbound

This paper cites Proximal Policy Optimization Algorithms.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Proximal Policy Optimization Algorithms

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.689779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.689779Z digest=sha256:0723a6aaff3fa87756f58b40f450d96618a34f6c1bf2bf8150d772662780b7bf

Observation 6d95310c-4341-4732-a79a-c1e3bcae33cd · outbound

This paper cites an unresolved cited work.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Unresolved cited work

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.692293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.692293Z digest=sha256:6aed27b9a88f4fa9158e60ebea8c376f10c4eecdc11af33ff41a65ff09391429

Observation 5439f3bd-5b71-454b-9616-ee3804e18e7c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.694929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.694929Z digest=sha256:7a27f7b6905f861a0893cc8780c1e8c8f303129e2564cbaead8aec101535a740

Observation 08bf06f9-9683-4cc3-b47e-4cd2db8693cb · outbound

This paper cites an unresolved cited work.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-06T18:57:39.485092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.697960Z digest=sha256:078d6b877cd82040fd278c3af33e8c156ecef21cd9457b48e512ecaac13bb4bc

Observation 451cb349-4f0e-4ef1-9500-466989e44479 · outbound

This paper cites Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.700774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.700774Z digest=sha256:2914adad25960002bb9c5e9fa56e9c39ad5b4095c588745e51bdba9e3ee45d0c

Observation fd9063f1-88c2-4cca-962d-8342577d4b07 · outbound

This paper cites Sutton and Andrew G.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Sutton and Andrew G

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.475642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.703468Z digest=sha256:671991765762cf899c40bff0174e317ac291299baf907c38887835be978a37c5

Observation 013e6b96-1d08-4581-a879-967f60f4dbef · outbound

This paper cites RL-finetuning LLMs from on- and off-policy data with a single algorithm.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model RL-finetuning LLMs from on- and off-policy data with a single algorithm

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.706318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.706318Z digest=sha256:41ed334b06b2050567cd1fd8b6a1926b85632e59296fdca61d15d8adb33fa56d

Observation 34a51081-e03b-4d3c-891b-ecf941f8de30 · outbound

This paper cites Reft: Reasoning with reinforced fine-tuning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Reft: Reasoning with reinforced fine-tuning

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.465782Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.709490Z digest=sha256:0b53dff0789c346b70797acba9f5b03999db3aa3721f1ba29f316b101aa5fd5a

Observation a646dfcc-7460-4a39-807b-28dd653aa209 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.712144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.712144Z digest=sha256:c7c584012567f9c0c43abb345ec3ae13db3c1f7e3aecc82bcb6d14bf752843b3

Observation 36d7c104-2b2d-4e9b-a5a0-310b1a3e7b01 · outbound

This paper cites Truly proximal policy optimization.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Truly proximal policy optimization

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.456135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.714875Z digest=sha256:ca9becc1767482412636847e1695fb2c698e1be9fca8872b7692d2fb042dfc08

Observation 37f24888-f153-448b-8e6f-c7327f052b92 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Chain-of-thought prompting elicits reasoning in large language models

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.446489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.717354Z digest=sha256:97959734479a613971a81a1f5fe040ebf2d2b48c5ef39bbfbed589322089229f

Observation f4d0928f-6f77-40d6-9eaf-e34070df6e62 · outbound

This paper cites Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.720506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.720506Z digest=sha256:a43de419342fa2f98e17a7902d0a4c1df93efcb5f52b4c48956ee55652b63a28

Observation 5c9d34cd-b56e-4fc3-ba0e-28c5d0378d74 · outbound

This paper cites Learning to Reason under Off-Policy Guidance.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Learning to Reason under Off-Policy Guidance

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.723557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.723557Z digest=sha256:a97082d2960995e76cd7cbe2fb54caa797817329b03f007738556fdb60185f3a

Observation 28f9f242-705e-4d1b-8ae8-cc19763f253b · outbound

This paper cites Qwen3 Technical Report.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Qwen3 Technical Report

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.726510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.726510Z digest=sha256:e1e0e712c943f8df640eeea8a6bd796735cf3ef6e18fa55722be9668b2f8eb37

Observation 1bd9843a-1ad8-4571-9604-2100e99d3afc · outbound

This paper cites ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.729636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.729636Z digest=sha256:58acf379e53fbeeeafb54b07aec803e1ddcbd247a75fc3aa50849f8add7adece

Observation 7ea91d13-5412-42af-b37b-2f39d9ddb1de · outbound

This paper cites Star: Self-taught reasoner bootstrapping reasoning with reasoning.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Star: Self-taught reasoner bootstrapping reasoning with reasoning

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.437299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.732780Z digest=sha256:c4069fe2c224e3e81e7501a6c0966afd5a1cd7fc9bfd8efef488671635976a62

Observation 67976d1d-e23a-47ed-b422-8588f9368580 · outbound

This paper cites Rest-mcts*: Llm self-training via process reward guided tree search.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model Rest-mcts*: Llm self-training via process reward guided tree search

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:57:39.427422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-06T18:57:38.735478Z digest=sha256:cda53d749987984e95ebe431a1d1e21fb2d35a970728edd3e3f2907483a7a1be

Observation 5bd67773-33ef-40e1-8585-8922dcb3f4fd · outbound

This paper cites AdaptThink: Reasoning Models Can Learn When to Think.

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model AdaptThink: Reasoning Models Can Learn When to Think

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T18:57:38.738111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:57:38.738111Z digest=sha256:d401275bd6c6b7ed7e261455cd1e795818b741d3b02334954e1b0eea8ead5feb

Pith citing papers

Observation 56a88053-8484-4f20-8e2e-d2afacf86fab · inbound

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies cites this paper.

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T04:39:03.382391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:39:03.382391Z digest=sha256:9486b7a1a01116b9a000b19c9604a8f0ed451b7b2351bad9b9b4d5b64cdaaa81

Observation f55dcc61-54c0-42e7-b913-376652390503 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 298

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:24.819691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:ac693f18e1883bbde67ec7db7d96559f9706c05c0a4586646b0c87e27a555f63

Observation 70c6515c-dc0f-448b-9b73-832627027942 · inbound

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models cites this paper.

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T16:48:02.883638Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-13T16:46:30.674244Z digest=sha256:8c5bbbcff7834d8c5bf05599ed584e57c83a81951565163b2fefc7b64e0bdec2

Observation 387033bb-6cb1-4f23-9b62-1a342820f39f · inbound

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space cites this paper.

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:41:04.087868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-05-10T12:50:57.603403Z digest=sha256:6155939ced3c855c2655d45a50dd8513a484157ac6786fba3d91f189b2872453

Observation b66fa036-e05a-4695-81bc-fef0a840ab7d · inbound

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning cites this paper.

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:56:13.385814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-05-10T04:29:21.897215Z digest=sha256:4d9567acb676813ef6e070197585f9cfd5aade4740eafb55625c5aaf437abbfa

Observation 6b03ad2d-f6af-45dc-92fa-3ad994e68e0a · inbound

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning cites this paper.

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 73

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:15:49.306961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-05-10T19:15:27.406778Z digest=sha256:f30500314897d01f87a0bb4cf3ebef9be26153e6016a24244869886c43812eed

Observation 92c5b202-9bfe-4c5c-b64a-08617c072a60 · inbound

Learning Agentic Policy from Action Guidance cites this paper.

Learning Agentic Policy from Action Guidance Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:07:17.618672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-13T05:02:49.206053Z digest=sha256:a971a4746d081df89b7b21c5cc64e27012580bd630c6537008e7a0dc56f722c8

Observation 1d775364-fee8-466c-b897-6c43696ec376 · inbound

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning cites this paper.

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-01T21:16:13.350886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-28T17:25:50.758630Z digest=sha256:70a4819597393338d4a9d0622e9231b214dbd6e24537f492663f6d5f910958d1

Observation 8710f2d7-6436-4e9b-b31c-6062714716a8 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 112

Resolution
verified exact
arxiv_id, observed 2026-07-04T08:09:40.704821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:962fa8e07d4793047a49ac1548384bfc0fee943c80d2e45d066900f0c545716b

Observation 894710be-2893-4b06-bcb2-48495fcf0ba9 · inbound

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents cites this paper.

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-11T14:43:39.668059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T14:43:39.668059Z digest=sha256:06dbe386c596f1549ab825e98cbd1e786d24bf77bca46741b6ab06eab16a8afd

Observation 4830619b-67bb-4586-920e-a111b79b15f6 · inbound

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples cites this paper.

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 50

Resolution
unresolved
no resolver link, observed 2026-07-14T11:23:30.063231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-14T11:23:30.063231Z digest=sha256:fb3cc49fb000935c13d764d27f783c103e0202f9a64dbed07ab3df23a43d7d5c

Observation a6ba5694-badf-4fad-8793-20ff8e40f96b · inbound

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples cites this paper.

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T07:23:28.818300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T07:23:28.818300Z digest=sha256:8e0904405e6a51e172369345a8e19bcf3f05478cd22be96ca3f6dd9198f17301

Observation f8a5b6de-1ab0-41b3-90ec-3cb6462a186e · inbound

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information cites this paper.

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T12:54:27.855935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T12:54:27.855935Z digest=sha256:4f49d2303239b95bc09e8c45750ed259c31dca8bbf1455110b579b8a83adce31