{"as_of":"2026-08-11T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2218b85cd21a6891495754c5ac59fdaa335ca57e4affdc1684d647387fe19ad","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:51:24.937566Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:165e59616c62de8187f50d13168eba126eea36caf36e3656068e24a2b52b2030","observation_id":"9ce80c5e-b8d2-4b1e-8cb6-e72c91dd252f","resolution":{"observed_at":"2026-05-12T08:41:23.526899Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2508.07809","last_updated":"2026-04-20T09:03:51Z","snapshot_observed_at":"2026-08-11T04:14:36.148394Z","submitted_at":"2025-08-11T09:49:01Z","title":"EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T23:56:47.274169Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2508.07809"},"observation_digest":"sha256:ff572ef467d1602f63eb3adad293dacbcbee3cf74309c63197fdfd1d7ea25a99","observation_id":"3f2dbca8-2b50-4732-998c-73f84649e9bb","resolution":{"observed_at":"2026-05-18T23:56:55.045505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T20:49:33.169961Z","title":"https://huggingface.co/blog/open-r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09883","last_updated":"2026-06-29T07:30:26Z","snapshot_observed_at":"2026-08-05T20:49:31.838349Z","submitted_at":"2025-08-13T15:32:25Z","title":"Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:33.169961Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2508.09883"},"observation_digest":"sha256:cd019cc6ee0914a17dd308bda660a72e367998c13143513800bb5ca009937eeb","observation_id":"f9961d65-2c5c-4622-923a-f528de674486","resolution":{"observed_at":"2026-08-05T20:49:33.169961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2508.13755","last_updated":"2026-04-12T13:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-19T11:51:40Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","version":8},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T22:33:01.074518Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2508.13755"},"observation_digest":"sha256:3fb63ad355e1dec39e91e98e16d54890da4adbd03c90b45a7083db1853e7b63a","observation_id":"e36dad10-0739-4a45-b78b-9b7028f14b24","resolution":{"observed_at":"2026-05-18T22:36:53.701052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":148,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:e63861e8e330b5bf742e03e5f4877ce14d10e22b3dfbfa800a5fcd2bd88b4f96","observation_id":"2d21066e-700b-4b6d-a68f-377c3c099a3a","resolution":{"observed_at":"2026-05-18T00:02:25.405749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T14:42:33.241269Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24088","last_updated":"2026-06-08T21:46:49Z","snapshot_observed_at":"2026-08-09T08:48:04.144510Z","submitted_at":"2025-09-28T21:47:20Z","title":"CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:42:33.241269Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2509.24088"},"observation_digest":"sha256:e4df6457885da255ed622e134fa87384565b3bd27e1b0b5d3fcfed697d1d1640","observation_id":"975e4c8d-006c-480c-b21b-c252f9e63794","resolution":{"observed_at":"2026-08-04T14:42:33.241269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T10:39:26.597119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-07T16:09:47.648297Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:26.597119Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:585ae6771d26fcc35ea40d82c8a18406997a621e07667471dc171807d3b7e192","observation_id":"a44f1f16-1fbc-4dc5-bee6-5a444af496a9","resolution":{"observed_at":"2026-08-04T10:39:26.597119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T09:33:38.707015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.707015Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:9263b46bf62ef6ad7459a2982998f964f6eb047b3003a591a83973bae6901724","observation_id":"95a5c8a6-8a44-46ff-b8ce-25da8195f68b","resolution":{"observed_at":"2026-08-04T09:33:38.707015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T08:15:50.322424Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-09T00:06:37.608642Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:50.322424Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:3cfa5123d6c802f4b5b82ef96aef7f2e37496daa004a2f923df33ef609b8cca0","observation_id":"336fcfdd-e5d7-437a-87d2-d788895f128a","resolution":{"observed_at":"2026-08-04T08:15:50.322424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:c98c4a0e7974505f5d7c933385995674fcdbb0443012b858fb86446d125dc7e7","observation_id":"50b95321-bffc-40e8-867f-d8c974c23178","resolution":{"observed_at":"2026-05-16T22:43:37.638943Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-03T05:28:11.662347Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02244","last_updated":"2026-07-14T10:18:39Z","snapshot_observed_at":"2026-08-07T11:20:54.293788Z","submitted_at":"2026-02-02T15:53:55Z","title":"Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T05:28:11.662347Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2602.02244"},"observation_digest":"sha256:69c51fbfb2ff4bca4061a9d7e85afdf593363839cde51c03362810175faf8c93","observation_id":"5853afe1-a468-491f-b111-8e395ab4a9a5","resolution":{"observed_at":"2026-08-03T05:28:11.662347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2603.11321","last_updated":"2026-04-04T03:49:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T21:33:41Z","title":"Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T12:44:50.752937Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2603.11321"},"observation_digest":"sha256:804caee9ef6d5b506fa57387719350c460df83b3bfc0948816a176ff80225f31","observation_id":"b00e54c2-0f98-4160-835d-a032820f5cf6","resolution":{"observed_at":"2026-05-15T12:45:37.356079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2604.14054","last_updated":"2026-05-25T13:50:41Z","snapshot_observed_at":"2026-08-02T01:13:47.904200Z","submitted_at":"2026-04-15T16:34:39Z","title":"$\\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:43:09.581054Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2604.14054"},"observation_digest":"sha256:335b47006da7fff25d6d32de0aeee8d1af37b6fc742df588ab11486b423a1c35","observation_id":"587b056d-a5f2-41cc-93fa-1a211b8b1ed3","resolution":{"observed_at":"2026-05-10T13:45:27.829704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2604.20733","last_updated":"2026-04-22T16:20:41Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:20:41Z","title":"Near-Future Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:36.580600Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2604.20733"},"observation_digest":"sha256:2b4fbba95cc79372e706407bb0d4b258e6afdaf882b91d999f58e6a4162a2b41","observation_id":"3b331609-45b2-472c-b100-ac69b4472109","resolution":{"observed_at":"2026-05-10T00:54:48.662477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.00610","last_updated":"2026-05-01T12:20:44Z","snapshot_observed_at":"2026-08-11T08:08:09.857201Z","submitted_at":"2026-05-01T12:20:44Z","title":"Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T19:05:51.423427Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.00610"},"observation_digest":"sha256:d710721ddea932a21c05cc009a53f2d8cdfb4809e43ccb01a21df59eb35c0ccb","observation_id":"7c4bd75f-8c56-4966-a086-5eedfcbb4d73","resolution":{"observed_at":"2026-05-11T15:51:44.011351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:df4a138078ae545f8ff7fed9fe0aabb6828d66cf12094bd245345323b418d43a","observation_id":"285b16b3-efde-4ca8-89b8-1e5350cd1871","resolution":{"observed_at":"2026-05-12T08:06:31.724069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:f8aa8850da1aa3cc6a2aae153360c211e639af9716f0b7979513837fa546adb0","observation_id":"83613a1d-44e0-467f-8c7c-ef40c35fc3ac","resolution":{"observed_at":"2026-05-19T18:07:42.235985Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-11T09:18:52.581172Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:3b65a6a1058802bcffda5485e68b225bdfc101cb17f05970039a587573ff02f0","observation_id":"859ffaa4-7137-4c9d-bc2d-2b543d12052e","resolution":{"observed_at":"2026-05-13T05:07:17.645623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.22567","last_updated":"2026-05-21T14:47:52Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:47:52Z","title":"LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-22T06:19:44.377733Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.22567"},"observation_digest":"sha256:3a0e498c858ff47712be8872516fba16a2547c85bb6e8de124796fd5ab52898d","observation_id":"96a80a11-f43d-46f4-a21d-eb95fc43ec92","resolution":{"observed_at":"2026-05-22T06:21:10.377765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.26184","last_updated":"2026-05-25T07:52:29Z","snapshot_observed_at":"2026-08-07T11:30:00.607943Z","submitted_at":"2026-05-25T07:52:29Z","title":"GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T22:29:05.467252Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.26184"},"observation_digest":"sha256:42153589b434d0a118fe297c6f4f2f0c45164e5672e0414cb1c22c574e258407","observation_id":"c60b7a7d-435d-4f00-bc9e-a0ce27f0fe67","resolution":{"observed_at":"2026-06-29T22:34:01.719169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:ecf3c5350a5946594f400588402c784aafb9f12f4a8e625c7861bad4cbddc65b","observation_id":"21f8c1db-3f48-42ea-9da4-fb704c60b231","resolution":{"observed_at":"2026-06-29T08:03:13.496547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:ebd527b5692722f5d3b99840b1bf5a4d8f5cfdbb237019e2cf5de427603192df","observation_id":"967da951-9120-4295-8a7c-68731a45b4d7","resolution":{"observed_at":"2026-07-04T09:09:43.590285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2606.24064","last_updated":"2026-06-23T02:14:12Z","snapshot_observed_at":"2026-08-01T19:53:34.208327Z","submitted_at":"2026-06-23T02:14:12Z","title":"Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T00:39:29.703711Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2606.24064"},"observation_digest":"sha256:db3af1c80a466cd09695ae8d62d29d23384b8a82f1ce69390655646095734869","observation_id":"ee13d56a-e9c9-4aa0-9614-253e730673ff","resolution":{"observed_at":"2026-07-04T16:29:56.991869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":"2506.19767","doi":"10.48550/arxiv.2506.19767","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":"ArXiv.org","work_id":"03d392b0-d6dc-44a8-bfdd-888ccbc9e68e","year":2025},"citing_paper":{"arxiv_id":"2607.01191","last_updated":"2026-07-01T17:24:26Z","snapshot_observed_at":"2026-08-02T15:51:49.700376Z","submitted_at":"2026-07-01T17:24:26Z","title":"Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-02T13:24:17.538850Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.01191"},"observation_digest":"sha256:55da5363acc38e575d452886678aa7a305ae9e2b7ca108195199d618c7504596","observation_id":"94116e2e-ed12-4903-acf6-fe4865d5320d","resolution":{"observed_at":"2026-07-02T13:26:58.442808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-07-14T11:23:30.063231Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-11T02:36:38.226273Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-14T11:23:30.063231Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:1e0f237f74fb1d495d2894bb2ec2b44aa76e673d6204d26f3191f7b1d612c587","observation_id":"151eb895-fbf2-4d7d-ba72-a03c726fcb31","resolution":{"observed_at":"2026-07-14T11:23:30.063231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-02T07:23:28.545828Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-11T02:36:38.226273Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.545828Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:11ed7cac97d2093ec21e0c4f8ac9c7e55a99cb2c78447a23eda896184fa5ce72","observation_id":"e7b7907b-ccc5-4b9b-be3f-b7943ba9f25f","resolution":{"observed_at":"2026-08-02T07:23:28.545828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-07T00:13:48.101782Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning.arXiv preprint arXiv:2506.19767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01755","last_updated":"2026-08-04T02:59:32Z","snapshot_observed_at":"2026-08-11T00:02:29.839636Z","submitted_at":"2026-08-03T06:24:36Z","title":"Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.101782Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2608.01755"},"observation_digest":"sha256:f022470ae43f5b73e4623884357e77612a6ab15f4d76ca276e4d60f1eef2afa0","observation_id":"b13a36df-6e61-4002-bd65-f7408ccdc670","resolution":{"observed_at":"2026-08-07T00:13:48.101782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-08T00:51:24.937566Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:24.937566Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:ff957443a0e07941a167f72a2d8e40736ec2b004d29adfb523c78c6ab021ab80","observation_id":"66463944-db0e-4f81-8a74-1a8135b269ac","resolution":{"observed_at":"2026-08-08T00:51:24.937566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19767/citation-record","integrity":"/paper/2506.19767/integrity","json":"/paper/2506.19767/citation-record.json","paper":"/paper/2506.19767"},"outbound":[],"paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2506.19767."}