{"as_of":"2026-08-09T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81f8af34ae7c11c381dea067c8183d2004aec57d268cace428fafa8e73ef3f4e","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:28:57.123789Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27787/citation-record","integrity":"/paper/2607.27787/integrity","json":"/paper/2607.27787/citation-record.json","paper":"/paper/2607.27787"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15777","last_updated":"2025-04-22T10:38:00Z","snapshot_observed_at":"2026-08-07T16:00:16.874744Z","submitted_at":"2025-04-22T10:38:00Z","title":"Tina: Tiny Reasoning Models via LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15777","snapshot_observed_at":"2026-08-01T01:28:55.596043Z","title":"Tina: Tiny Reasoning Models via","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:55.596043Z"},"links":{"cited_paper":"/paper/2504.15777","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:6a153cdbfe09ede09ad550b36832a80233d93e2bfdd692da69676dce3d32cee7","observation_id":"0f0a37e7-5dd7-44d0-9cc5-833ec769b190","resolution":{"observed_at":"2026-08-01T01:28:55.596043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:55.668707Z","title":"arXiv preprint arXiv:2506.07527 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:55.668707Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:6de3d95f3598d696711caa01f45a02c07d284f22f91c1aa7e117d30d26877747","observation_id":"1e50381b-8495-4fee-8f2e-e3fd4db4bd9d","resolution":{"observed_at":"2026-08-01T01:28:55.668707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06948","last_updated":"2026-05-30T09:01:09Z","snapshot_observed_at":"2026-08-04T22:56:01.963927Z","submitted_at":"2025-09-08T17:58:02Z","title":"Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06948","snapshot_observed_at":"2026-08-01T01:28:55.739458Z","title":"arXiv preprint arXiv:2509.06948 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:55.739458Z"},"links":{"cited_paper":"/paper/2509.06948","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:5f19b140d67905e610f513995c2fd7faf9273edc976e410a31f482ac12573f88","observation_id":"5db1f480-06ca-44b2-9dda-d0bf5756f576","resolution":{"observed_at":"2026-08-01T01:28:55.739458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:55.804128Z","title":"arXiv preprint arXiv:2603.23871 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:55.804128Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:3f4894556164b25c253fee02cfd7a41dc0758a821001d6c9a9153f72da9f2270","observation_id":"ed2134da-3e3b-48b4-a765-437228c091dd","resolution":{"observed_at":"2026-08-01T01:28:55.804128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T01:28:55.868005Z","title":"and Wu, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:55.868005Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:c7d6f35052534197b7cd70ac0b976a9aa61bb33d0214fcbbfb83aac6f73a9de4","observation_id":"3dfaeff7-2e76-4d4a-aa44-f287a72a3801","resolution":{"observed_at":"2026-08-01T01:28:55.868005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T01:28:55.933165Z","title":"arXiv preprint arXiv:2503.14476 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:55.933165Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:310089b9c3bd9d28548885c66e221466610e4eadbae85a918f9e101ea60067bc","observation_id":"8d577706-0b84-40fa-a279-107c03bb98fe","resolution":{"observed_at":"2026-08-01T01:28:55.933165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T01:28:56.048240Z","title":"arXiv preprint arXiv:1707.06347 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.048240Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:1f2cc18420235496a9599eb35c1b1d2ecc451a1bddd61a436b6e4e0bfac9d21b","observation_id":"dc8666ee-9c78-461b-8061-8a6766171add","resolution":{"observed_at":"2026-08-01T01:28:56.048240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T01:28:56.118443Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.118443Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:d455eb20045ba2fdc29bcf477b1a906a49dea3a542ab73c874d883603f076021","observation_id":"9a609134-d9db-4a73-af55-5bd7091cdc5c","resolution":{"observed_at":"2026-08-01T01:28:56.118443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T01:28:56.176653Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.176653Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:ea6a38fda4e68d143ac47572ca12d4e130cd563fccf32689ecd86d16e7120de0","observation_id":"86296fed-8a99-430f-88c2-a5cd2006e074","resolution":{"observed_at":"2026-08-01T01:28:56.176653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-01T01:28:56.250910Z","title":"arXiv preprint arXiv:2504.11456 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.250910Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:556f1b82d42bb51f046b62b4d85cad9d8b962fc618985a41c75871398a3b922e","observation_id":"72fd49f8-e1e1-40ae-961e-20159b36095b","resolution":{"observed_at":"2026-08-01T01:28:56.250910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.314615Z","title":"Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.314615Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:acf734c1b63bea15451b659aa943dfd9bf41ed9dd4ba39f4d744c010738cc205","observation_id":"aab03436-8a35-4566-ac31-d16a11b3dfbd","resolution":{"observed_at":"2026-08-01T01:28:56.314615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.378939Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.378939Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:2bbe3c0ef636b26dcf4f531d8010dac6a8ceb72c2558ac3c862fd2b6ebbf5e6d","observation_id":"b2ab55e9-f415-4fd1-b962-59834df789e2","resolution":{"observed_at":"2026-08-01T01:28:56.378939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.405734Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.405734Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:6c005301fccba4d14477f013509d323b0839a9945d591d88d215fde04abfd615","observation_id":"6ec18f94-a102-46f5-b48b-f740d5d70b10","resolution":{"observed_at":"2026-08-01T01:28:56.405734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-01T01:28:56.470597Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.470597Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:e8c1433343fdff33216bbf8dc83bd2662d1c887a95376928a07c52e2b6687392","observation_id":"15a322e6-43e8-4c23-82bf-bb4f8775ecf0","resolution":{"observed_at":"2026-08-01T01:28:56.470597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.627338Z","title":"Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.627338Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:27e74fb65701f9734d9d0b7ff0432ba5b22dc79b2ea3901d15eb8ebd64a433d2","observation_id":"4495b5d9-cd5e-4933-b98b-7ca4606f0f15","resolution":{"observed_at":"2026-08-01T01:28:56.627338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-01T01:28:56.693276Z","title":"arXiv preprint arXiv:2506.13923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.693276Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:1520d407d0934d466f607930633908ec9ac7fc095dd531e1a1d0471379bc0836","observation_id":"994c961a-99d7-4a9e-8378-21d7cd9ceb46","resolution":{"observed_at":"2026-08-01T01:28:56.693276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.748724Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.748724Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:451709ec23321397c082b6f80ed143d93fc547a8f612254f25b6ab82a927694e","observation_id":"4ec73280-de7c-4484-9790-8ab6114ce01c","resolution":{"observed_at":"2026-08-01T01:28:56.748724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.816872Z","title":"arXiv preprint arXiv:2602.03143 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.816872Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:000fc1e11ad1a53f2ad4b085d7efb8af5cd848c75942f4856f8204ae92897950","observation_id":"a28dfa1e-ec7f-4daf-9161-39c79fab2afe","resolution":{"observed_at":"2026-08-01T01:28:56.816872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.878791Z","title":"arXiv preprint arXiv:2604.00698 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.878791Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:db451bf7353ccecc8ca0418bf61ee8f28b3e900f5015d53d17ede19b97782a0f","observation_id":"44774df2-16d2-449b-ad90-d338b1fb4e2f","resolution":{"observed_at":"2026-08-01T01:28:56.878791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:56.929960Z","title":"Nudging the Boundaries of","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.929960Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:54fa395cb7233e9ca8f84d102a83976842f7c383706e13bcae676d1bf5a25326","observation_id":"36266788-8891-4384-989c-d055085520ef","resolution":{"observed_at":"2026-08-01T01:28:56.929960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.003113Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.003113Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:be87df102b23bb2d02d0d0ea49f5926f75b80bca7fdd137d4356e03532e88953","observation_id":"96aa2ad7-4baf-4a65-8b3c-8389cd68567b","resolution":{"observed_at":"2026-08-01T01:28:57.003113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18216","snapshot_observed_at":"2026-08-01T01:28:57.015362Z","title":"arXiv preprint arXiv:2606.18216 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.015362Z"},"links":{"cited_paper":"/paper/2606.18216","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:7fd2d8446ff3c0e7b07d4920b95a2ded947baee212c16a566a8687a90862791e","observation_id":"e44efb7f-7866-4efa-bc4f-8b03875d0489","resolution":{"observed_at":"2026-08-01T01:28:57.015362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.021388Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.021388Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:0d1d8a97281187fc7309566884304495970abc584b3c39671fb20d8405b1b498","observation_id":"f8002cd4-72a9-4660-8c2a-48c472e5bda0","resolution":{"observed_at":"2026-08-01T01:28:57.021388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.026690Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.026690Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:eb25170cf1177a8bf5f53e0a716ac55b99ad2e98a88d16942d60b66f80d3393d","observation_id":"febe30bb-ebf8-499c-800f-b25b943b293e","resolution":{"observed_at":"2026-08-01T01:28:57.026690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.032975Z","title":"and Jeon, Myeongho and Vu, Kim and Lai, Viet and Yang, Eunho , booktitle =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.032975Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:b4e16d7c8aaef0d4a6459d9254c294644434d2e59cab9e4a23a17fb46316bd9f","observation_id":"57629963-d642-40e3-bd50-702dc651009b","resolution":{"observed_at":"2026-08-01T01:28:57.032975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.038231Z","title":"Don't Waste Mistakes: Leveraging Negative","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.038231Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:b7fae18913f9bff1cfe44ecf88369934c4a0426553f8723e0742cb45ba3625dd","observation_id":"2383483f-77f7-4825-baa7-7a6489d929fa","resolution":{"observed_at":"2026-08-01T01:28:57.038231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.043917Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.043917Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:f85302eedb74feedd3bf1bd849bd7eccf568fcdab069347c00af2a278cd2f1c6","observation_id":"8371c59e-caf1-4dd7-8099-7f61e6cc8e03","resolution":{"observed_at":"2026-08-01T01:28:57.043917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.049520Z","title":"Learning-Zone Energy: Online Data Selection for Efficient","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.049520Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:c1fbb0cfb2db063057e7c0db39d820465e3763fd1ffb1f134fce0b68b455182f","observation_id":"867c3a41-5dea-48b4-90af-b8473fb3ac32","resolution":{"observed_at":"2026-08-01T01:28:57.049520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.055572Z","title":"Advances in Neural Information Processing Systems (","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.055572Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:06343e78eaabc0c438d18d3f259a7296705adb36611cc0c4a7f4bd35b367e834","observation_id":"4f2ddb01-de73-45dc-9642-0555e779ac66","resolution":{"observed_at":"2026-08-01T01:28:57.055572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.060474Z","title":", booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.060474Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:5f09fb091d364cf1dc60ede8bf3560975f0147052bf91f43be0d3d700fdd49da","observation_id":"b4b379e5-4de0-40a8-8c4a-8349696534d3","resolution":{"observed_at":"2026-08-01T01:28:57.060474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-01T01:28:57.065296Z","title":"arXiv preprint arXiv:2308.01825 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.065296Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:327329a2a8999965a946bd54c4a5e3228e8d778f3e7f9814dec4f47130530a7f","observation_id":"1d9fe803-993c-41df-8b11-df54279391a9","resolution":{"observed_at":"2026-08-01T01:28:57.065296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.071439Z","title":"Reinforced Self-Training (","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.071439Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:d8195fb230ee409b3be7c407f1ec69e26ed189877a4ef7ff842146607658190a","observation_id":"4d3af5fb-81d3-4b49-8cb9-37789a57780c","resolution":{"observed_at":"2026-08-01T01:28:57.071439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.076222Z","title":"Transactions on Machine Learning Research (","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.076222Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:86922ec035c2dc54c5e387a130279e18629aabe06b5ce5c308c1eaa0859b2c87","observation_id":"08879f88-e5ab-4680-8ffd-5309f37c4f48","resolution":{"observed_at":"2026-08-01T01:28:57.076222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.081170Z","title":"Learn Hard Problems During","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.081170Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:f4ab537a624a6c8b81b288209e6d24080938511810626a549bc123102cf9257b","observation_id":"ce414c73-cf32-4c85-863a-2c5b02663067","resolution":{"observed_at":"2026-08-01T01:28:57.081170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.086165Z","title":"Robotics: Science and Systems (","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.086165Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:584d05f2f3716a620331606cedbcaeb599037a930c69a16ccc9028f5483573f5","observation_id":"e738eace-afee-47af-b3bc-b827e9956532","resolution":{"observed_at":"2026-08-01T01:28:57.086165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.091777Z","title":"Advances in Neural Information Processing Systems (","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.091777Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:4ea56a3ec61fb39dfe55e93b2ac512e43532d3e9a01d98c4dd6ac6ce812d8cf2","observation_id":"08a5c976-f6cc-4178-aab0-586be606dc7a","resolution":{"observed_at":"2026-08-01T01:28:57.091777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.098425Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.098425Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:86e66cfcff84a907d5f5c37c0296fd109c51ec14af98458411a859aef0a7436d","observation_id":"b7f6980c-6371-495c-8c23-170743bfbe5d","resolution":{"observed_at":"2026-08-01T01:28:57.098425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-01T01:28:57.103793Z","title":"arXiv preprint arXiv:2502.01456 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.103793Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:30065d1845339f3addb89493a776c6c4499574e78ed218020725e7bcf6b0ba89","observation_id":"b5355ae5-d164-4197-8444-a5fd2b447f52","resolution":{"observed_at":"2026-08-01T01:28:57.103793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.109916Z","title":"Efficient","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.109916Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:62bc7d7365c3e32e5f8796d5f4cde9c884add94506859d0c58b429cf33e2a426","observation_id":"1c9b497d-6b11-4188-b807-6a05c317ccd3","resolution":{"observed_at":"2026-08-01T01:28:57.109916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:28:57.123789Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:57.123789Z"},"links":{"citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:79ad10ca241b757b82b720ef1d7d2ea282051d495054ed5669a1a8d6103eefbd","observation_id":"a0005115-698a-4cb8-bfa5-8e2ecc2e6567","resolution":{"observed_at":"2026-08-01T01:28:57.123789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.27787."}