{"as_of":"2026-08-10T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1286aa9a7a9b7d8dcc4b3e818506a8eca1e389d8af235180fb1fa9623fe1dc63","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-07T16:22:55.342495Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05339/citation-record","integrity":"/paper/2607.05339/integrity","json":"/paper/2607.05339/citation-record.json","paper":"/paper/2607.05339"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.111606Z","title":null,"venue":null,"work_id":"c36e66cf-4882-4f2e-9965-5d839ed36c7f","year":2016},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:09308585e800379cc4e8d95ff6f0ac7ab6d923acb94da0d0a8ff9a81f44c8b0f","observation_id":"80fd619e-8d26-41d4-bcfd-4500c6ca129d","resolution":{"observed_at":"2026-07-07T16:24:01.114846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:03edf99363c66bcdf3f1b02df1765688f10139d593135f980fffc0e18a34a39d","observation_id":"5352be6f-0bc7-4a50-833a-a960d1605d4f","resolution":{"observed_at":"2026-07-07T16:24:01.004931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":"2306.13649","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-07-09T21:06:34.855301Z","title":"Yoshua Bengio, Jérôme Louradour, Ronan Collobert, and Jason Weston","venue":"cs.LG","work_id":"78b7a553-fd43-4995-b559-e95779797d3f","year":2023},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:a41f9aed65c937e7f4db3a347a6b8fe35198a07c6b5bd3cb7e7245c7e5c83d1f","observation_id":"6633503d-8a18-4a48-818e-a0717298c2f7","resolution":{"observed_at":"2026-07-07T16:24:01.039917Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26844","last_updated":"2026-05-26T10:56:46Z","snapshot_observed_at":"2026-08-08T04:38:50.480074Z","submitted_at":"2026-05-26T10:56:46Z","title":"Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.26844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.26844","snapshot_observed_at":"2026-07-07T16:24:01.075911Z","title":"Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation","venue":"cs.LG","work_id":"99c81a83-5ae9-43ef-9c84-3be075bceb03","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2605.26844","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:30ffeb01007e634e879680ddbb28e3135e684665306a4db523e7effde2a0c7ee","observation_id":"ff8e90aa-e930-490e-9926-7509fb356e77","resolution":{"observed_at":"2026-07-07T16:24:01.079034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11178","last_updated":"2026-04-09T18:32:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-11T18:00:05Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence","version":3},"cited_work":{"arxiv_id":"2603.11178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.11178","snapshot_observed_at":"2026-07-07T16:24:01.041397Z","title":"PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence","venue":"cs.AI","work_id":"c8f1ef8c-6864-40cf-94f6-44015fe40981","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2603.11178","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:72fc7c89feab1f92188870be0bcba32a7478987a41f520a6e25e1c1c6c92df2d","observation_id":"074eaec9-0a3d-4dea-b54b-31bc0f77c52d","resolution":{"observed_at":"2026-07-07T16:24:01.042864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:c40e3174fba61106d41f5501aa515693f8b617a20eeaa7215f93696f2bc2f064","observation_id":"751d1dbc-e511-49da-ab79-ee3f3978eab6","resolution":{"observed_at":"2026-07-07T16:24:01.097345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.10601","doi":"10.48550/arxiv.2305.10601","metadata_source":"pith","pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","venue":"cs.CL","work_id":"07adb06e-4ed5-4ec5-a7ae-ff288fd214fb","year":2023},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:d17ee6c7254700fe3c304bc2f2c11dd5d3abb76418bb99111634ae5647b75a98","observation_id":"c63a4003-8702-4dab-83f6-e875f8d999fe","resolution":{"observed_at":"2026-07-07T16:24:00.996759Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:a98777ac6d217167b2420e4c9037622048be2094ded22294c1f55ee466b27089","observation_id":"ce4c47c0-24b1-47a2-92af-e5d57f20c716","resolution":{"observed_at":"2026-07-07T16:24:01.047960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:9a1312755fd205721b7ab36c2bc99cbb984386dff1ba4d4df7f38fe469343c11","observation_id":"248af4a3-40d6-4158-b03e-eb2f46dacadb","resolution":{"observed_at":"2026-07-07T16:24:01.085334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-06T07:25:42.562786Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":"2203.07540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-07-07T16:24:01.070122Z","title":"InACL, pages 9426–9439","venue":"cs.CL","work_id":"06c02062-aac6-4fed-a547-067bbaa6f2ac","year":2022},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:462557b0f5c85c9ac7254498a3283b837c71457dde601c10bb09853a27cb4dc0","observation_id":"a7fba036-a782-4d1e-bef0-4fb3cb71fdeb","resolution":{"observed_at":"2026-07-07T16:24:01.073239Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.012815Z","title":"Learn hard problems during rl with reference guided fine-tuning","venue":null,"work_id":"cca99282-a0f6-4e3b-894f-0589afedb0de","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:2d9b2fad3d3d1187488c878a2a21143a43433b25f2d54100f7a7677f0430e6dd","observation_id":"c0781527-49b7-4801-b333-8456bfad9bdf","resolution":{"observed_at":"2026-07-07T16:24:01.015130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:308bc11047d5539cb5d566a8df1ecc81b031a7376ab4dacac13f5686279c9bff","observation_id":"f0e7e388-ff58-4425-a764-6195cda5f8ce","resolution":{"observed_at":"2026-07-07T16:24:01.067687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-08-10T22:09:10.121513Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":"2604.12002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-07-10T01:46:41.091851Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","venue":"cs.CL","work_id":"075fcc48-23c0-4231-bf6e-c629eb2a169b","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:c810f2e0efc590ee9524e00c3d3f14604e955f8a4ac6e0b18f559eb06cfe9bd1","observation_id":"7e044e34-5c57-4bce-8caa-255f67e81ed3","resolution":{"observed_at":"2026-07-07T16:24:01.033844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.02288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.050266Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing","venue":null,"work_id":"6dea6cb7-a4e5-478a-ab3c-eeeb335abd51","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:bd64b31baafbb1f6299d1bcfee6aaeb088e5a2c1b501ca343fa43bf2023e6c3e","observation_id":"68754d8a-47c3-4562-9926-71451d911559","resolution":{"observed_at":"2026-07-07T16:24:01.053970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-03T02:52:57.588273Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":"2605.03677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-07-07T16:24:01.100431Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","venue":"cs.LG","work_id":"e85ce97d-13f1-4b08-ab67-e6657c8bd187","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:bf6631ff16cd467cbab6d389f78909b712056d34841c2a5c7944f2fdeb9b2a55","observation_id":"0e522810-a5e4-4478-a6ae-0e83353208e8","resolution":{"observed_at":"2026-07-07T16:24:01.103354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":"2604.13016","doi":"10.48550/arxiv.2604.13016","metadata_source":"pith","pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","venue":"cs.LG","work_id":"42b43df0-4c82-493f-9d9b-1be8c116d9af","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:484cd01bc3f414ac95cdfcae5b749ae66c4451022da8c1f2c0bfe183c94f21d6","observation_id":"e49b3531-1c2d-4a64-a419-f497a9e0e943","resolution":{"observed_at":"2026-07-07T16:24:01.037165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.605597+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.605597+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10643","doi":"10.48550/arxiv.2511.10643","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Black-box on-policy distillation of large language models.arXiv preprint","venue":"ArXiv.org","work_id":"1e58a1be-9294-4bd3-8040-3516dcebcd4a","year":2025},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:f914b1a24ce281a10f5a8744feec8a9aa6acc9f7e0472e62faff766aed12e348","observation_id":"f84730e4-135e-4d18-ac39-ede5209b6f0a","resolution":{"observed_at":"2026-07-07T16:24:01.023987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":"2303.17651","doi":"10.1007/s10664-008-","metadata_source":"pith","pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":"cs.CL","work_id":"59181e7f-e58e-45d3-8146-4477a9f53d5a","year":2023},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:9076c976a23ac3222450e27ffe7db10a60c0626b6c92c18a063f96dbf1c79efa","observation_id":"b9e19399-1ae3-4466-ab36-2a952f75ea88","resolution":{"observed_at":"2026-07-07T16:24:01.030689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:fc67b6905b842bf419695dc645dd3f8957420ebe89fcf495a223e9c0435ef0d9","observation_id":"b249f26c-14a1-4331-a12d-4ee15eaae7d8","resolution":{"observed_at":"2026-07-07T16:24:01.000144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":"2210.11610","doi":"10.48550/arxiv.2210.11610","metadata_source":"pith","pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models Can Self-Improve","venue":"cs.CL","work_id":"6830fb5e-ffe7-4200-8b19-a56a5152a37a","year":2022},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:9e7092767d35c9652ecfe084bb90ebf5852ebd6cd8431836f7f786aece7c2042","observation_id":"5dba23c9-7194-410c-8aa0-94905afb19d5","resolution":{"observed_at":"2026-07-07T16:24:01.011439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:22.369728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:22.369728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06726","last_updated":"2022-10-13T04:50:02Z","snapshot_observed_at":"2026-07-06T14:04:32.971017Z","submitted_at":"2022-10-13T04:50:02Z","title":"Explanations from Large Language Models Make Small Reasoners Better","version":1},"cited_work":{"arxiv_id":"2210.06726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.06726","snapshot_observed_at":"2026-07-07T16:24:01.017131Z","title":"Explanations from large language models make small reasoners better.arXiv preprint arXiv:2210.06726","venue":"cs.CL","work_id":"69d4761a-0735-43d1-8632-e6130261f75a","year":2022},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2210.06726","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:0b3a3988c9cb3f9f9a8a3a4cc6cc0bdfc8443b9a00f1b489024610e999d99414","observation_id":"4edc7a00-cbb0-46c6-bd20-dbf8595f699c","resolution":{"observed_at":"2026-07-07T16:24:01.020296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.104575Z","title":"Distilling step-by-step! Outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"1cb02538-e06e-4175-8769-6f33557af76f","year":2023},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:2259b3b220fbf538c660cec599a4d12aa5963776fbaa4985f9ea725a0669bff0","observation_id":"c88f63a8-01cb-4ef6-a526-ebeaa3148fb1","resolution":{"observed_at":"2026-07-07T16:24:01.109437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17717","last_updated":"2025-02-24T23:17:52Z","snapshot_observed_at":"2026-08-07T17:51:42.511988Z","submitted_at":"2025-02-24T23:17:52Z","title":"Knowledge Distillation with Training Wheels","version":1},"cited_work":{"arxiv_id":"2502.17717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17717","snapshot_observed_at":"2026-07-07T16:24:00.987971Z","title":"Knowledge distillation with training wheels.arXiv preprint arXiv:2502.17717","venue":"cs.CL","work_id":"efafc10c-f6f8-403c-a3eb-bd7daf94d2b3","year":2025},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2502.17717","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:6139abdffbd6608daf4a4d0e686da9b15243e2135db00a6f79eb40146b705806","observation_id":"d0388e6d-e7ad-4743-8324-16ab7979439e","resolution":{"observed_at":"2026-07-07T16:24:00.992883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.1152","doi":"10.20944/preprints202603.1152.v1","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codes: A context-efficient framework for enhancing small language models via domain-specific adaptation and model ensembling","venue":"Preprints.org","work_id":"091ea5ac-3bb6-4fc9-b1b7-84ff327882ce","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:809ae45bde1f798173a06ba48099b79cbf30d455af2fd2cb99d62674962e960c","observation_id":"95e4f408-5e2b-441d-b11d-8da9c6048c83","resolution":{"observed_at":"2026-07-07T16:24:00.985351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:49:35.126366+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:49:35.126366+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28725","last_updated":"2026-06-27T04:10:45Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T04:10:45Z","title":"DriftGuard: Safety-Aware Multi-Monitor Detection and Selective Adaptation for Evolving Toxicity Moderation","version":1},"cited_work":{"arxiv_id":"2606.28725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.28725","snapshot_observed_at":"2026-07-07T16:24:01.087571Z","title":"DriftGuard: Safety-Aware Multi-Monitor Detection and Selective Adaptation for Evolving Toxicity Moderation","venue":"cs.CL","work_id":"98ed72a3-5f62-4278-aab7-daf8a150dc24","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2606.28725","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:41b49a8b075f2509933c017d7d9f96134ce6f557c939ee51391d0b9904260fab","observation_id":"811c02bb-30bc-4395-9d72-89f511531161","resolution":{"observed_at":"2026-07-07T16:24:01.090823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22495","last_updated":"2026-06-17T23:32:06Z","snapshot_observed_at":"2026-08-07T05:05:50.314879Z","submitted_at":"2026-02-26T00:20:39Z","title":"Reinforcement-aware Knowledge Distillation for LLM Reasoning","version":3},"cited_work":{"arxiv_id":"2602.22495","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.22495","snapshot_observed_at":"2026-07-07T16:24:01.056987Z","title":"Reinforcement-aware Knowledge Distillation for LLM Reasoning","venue":"cs.LG","work_id":"e1b3cffd-f5ae-4eb9-abb7-6df5fa58497e","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2602.22495","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:43c92e2509ae698e4f403b23ef0946bd6dc61f109e7742540f61f5f84e093b8f","observation_id":"49cc97da-1f47-49f0-b1ac-383d63a66841","resolution":{"observed_at":"2026-07-07T16:24:01.060405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:11e336d05bf585ee0c42372db571b9b01cb6dc9bcbac21451704dbed0217635b","observation_id":"4e3e0f65-0415-4218-a492-0faf2c693271","resolution":{"observed_at":"2026-07-07T16:24:01.026792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:d73105a4dbcc1b811ae4d9f432a343915b090bf608bc2ca423d579ba6dbee199","observation_id":"82644a5a-4930-4ea6-9580-ee56a8ce3e35","resolution":{"observed_at":"2026-07-07T16:24:01.008182Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.116434Z","title":null,"venue":null,"work_id":"5894f213-04d4-475b-97e7-efbde697c4af","year":2024},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:7aa2de2eed7e695d03ec2abb2c2421454c496c9eb228a52e8baac72da5250be8","observation_id":"cd089bc9-d9f3-4a1e-8fc8-79639bc469e3","resolution":{"observed_at":"2026-07-07T16:24:01.119416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-09T23:18:25.151281Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":2,"verified_exact":21,"verified_fuzzy":1},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.05339."}