{"as_of":"2026-08-15T09:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e74f80ae39798b4a2d06f5b9e5334f69be663d451daf4a8cd88ad5ce8aa7d678","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:11:14.891530Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:53:37.179431Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.732193Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-11T20:53:37.179431Z","title":"Self-improvement in language models: The sharpening mechanism.arXiv preprint arXiv:2412.01951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05232","last_updated":"2025-07-03T18:06:35Z","snapshot_observed_at":"2026-08-14T13:58:04.180134Z","submitted_at":"2024-12-06T18:02:59Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:53:37.179431Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2412.05232"},"observation_digest":"sha256:32f2b8239b2b99b03e92c68a0bb8983945f684d2a8d56ed04432428209f19cf7","observation_id":"f5053f7f-ac80-44c3-aa4a-e6ed349a16f9","resolution":{"observed_at":"2026-08-11T20:53:37.179431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-09T14:54:29.183688Z","title":"J., Rohatgi, D., Zhang, C., Simchowitz, M., Ash, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01612","last_updated":"2025-02-13T05:32:54Z","snapshot_observed_at":"2026-08-15T08:57:38.014688Z","submitted_at":"2025-02-03T18:45:22Z","title":"Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T14:54:29.183688Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2502.01612"},"observation_digest":"sha256:c9c42d15b1bc4338785fdf9c0c71d61c229e4575b3cfbfb12aada8d8d54500ca","observation_id":"715ea1a9-cf4b-474f-b290-e9e02e7b081d","resolution":{"observed_at":"2026-08-09T14:54:29.183688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-13T03:09:24.809367Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:4209297ca55c8e88769f92625b85441da889308cf6b04330792bc605452626ab","observation_id":"e68c7525-f7e4-48db-906e-ced8dded2667","resolution":{"observed_at":"2026-05-18T15:58:33.372875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T13:35:51.425938Z","title":"Self-improvement in language models: The sharpening mechanism.arXiv preprint arXiv:2412.01951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.425938Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:d405d24d151290b9c2e4d996d476caf87ccfb069708dae4576edf08af55d632e","observation_id":"b479d45d-7c4b-4ae8-800e-17e7f52fb058","resolution":{"observed_at":"2026-08-07T13:35:51.425938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T10:35:35.274446Z","title":"Huang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-14T06:29:20.553603Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:35.274446Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:9511515fa9982d41a52149571ad1018d59dd7d826edb12c0eca7c4ee7bf1eea5","observation_id":"179cc3d2-eb8c-4a8f-a54d-9aa6771e01ee","resolution":{"observed_at":"2026-08-07T10:35:35.274446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T05:03:26.163556Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-14T00:13:00.965119Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.163556Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6561efcaa036de99b5a07f7626c9ee173ea0ee21105748ba043a8b69eb9151f1","observation_id":"2244849d-c21a-4ff2-82fb-0ec8ec7e670a","resolution":{"observed_at":"2026-08-07T05:03:26.163556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-05T23:06:49.580054Z","title":"J.; Rohatgi, D.; Zhang, C.; Simchowitz, M.; Ash, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-13T04:45:14.014270Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.580054Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:e2acbd732c458fc5bc956c901e8efe973f1879d03535247c795f07a64001e73d","observation_id":"c99e57b6-dc00-4d09-b4a1-c0c4d0d6ae38","resolution":{"observed_at":"2026-08-05T23:06:49.580054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-03T03:04:43.702241Z","title":"Self-improvement in language models: The sharpening mechanism.arXiv preprint arXiv:2412.01951, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.702241Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:0f896d5149171a2ea54a1031d612c96d8a1b2a43457b8816b81f1fc5f02158c0","observation_id":"c83422e7-447b-4537-a2bf-d80056733181","resolution":{"observed_at":"2026-08-03T03:04:43.702241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-03T02:43:35.074111Z","title":"Self-improvement in language models: The sharpening mechanism.arXiv preprint arXiv:2412.01951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10014","last_updated":"2026-05-31T19:13:22Z","snapshot_observed_at":"2026-08-06T02:34:35.293978Z","submitted_at":"2026-02-10T17:36:41Z","title":"A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T02:43:35.074111Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2602.10014"},"observation_digest":"sha256:2b91d0dea13c322009612c8c598d82f669d6b0083d311f592ec3162a2fcd2c58","observation_id":"d9e3b4c8-2b19-4b7e-8c88-eaf2aad9f39a","resolution":{"observed_at":"2026-08-03T02:43:35.074111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"J., Rohatgi, D., Zhang, C., Simchowitz, M., Ash, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-08-14T16:50:18.152608Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:01665f411334bc26b8771aaa23f61e63b418aa17fa3cee1d76ee7310e3152c05","observation_id":"b8022d91-06f9-4e48-80f0-26072928b072","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2604.04855","last_updated":"2026-04-06T16:58:20Z","snapshot_observed_at":"2026-08-11T02:41:21.928926Z","submitted_at":"2026-04-06T16:58:20Z","title":"The Role of Generator Access in Autoregressive Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T20:16:46.370831Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2604.04855"},"observation_digest":"sha256:5ec8c27e4eec64ccee581df249c98556c91cde11bef5e3fbf0c2a8989c935079","observation_id":"4d7ed3f2-720a-485e-9dfe-8f0a24d7d7ac","resolution":{"observed_at":"2026-05-10T22:05:48.110480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2604.16259","last_updated":"2026-04-17T17:17:55Z","snapshot_observed_at":"2026-08-12T19:06:49.955269Z","submitted_at":"2026-04-17T17:17:55Z","title":"Beyond Distribution Sharpening: The Importance of Task Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T08:07:14.691463Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2604.16259"},"observation_digest":"sha256:5c701e18d561ff81e248d2a35141ec120b446646e12314f31e0621be4a19a077","observation_id":"0e98ced7-f560-41da-bdbd-eb0e9d7fb3c8","resolution":{"observed_at":"2026-05-10T09:08:27.037680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:acd91a2dcdba16f9637b3c62381d81706bac482459fb9f2031be78dae34aa472","observation_id":"73f72c26-913e-4e00-9097-f07e002fca28","resolution":{"observed_at":"2026-06-28T17:22:24.862765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:9a2e59313de4cc242279a9590a9b49041fa17cdfae0a30eecdcd5899b8dbfc1f","observation_id":"51af3dc1-1f41-4b67-8962-6fdb0545fc90","resolution":{"observed_at":"2026-07-01T20:56:13.665777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2606.03962","last_updated":"2026-06-02T17:50:14Z","snapshot_observed_at":"2026-08-13T10:28:09.065513Z","submitted_at":"2026-06-02T17:50:14Z","title":"Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:44.092482Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2606.03962"},"observation_digest":"sha256:097f5eeb9f24ef2d4167c7f42ab86213c992c7a16d353ec9d81b9a0e2217b9b4","observation_id":"70c40a63-4681-4129-b016-7a5f5524e943","resolution":{"observed_at":"2026-07-02T02:26:26.274337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":"2412.01951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-07-03T14:08:21.732193Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":"7f90ec4b-7277-4b8a-b651-135711d76650","year":2024},"citing_paper":{"arxiv_id":"2606.13125","last_updated":"2026-06-11T09:51:35Z","snapshot_observed_at":"2026-08-09T16:28:13.819548Z","submitted_at":"2026-06-11T09:51:35Z","title":"Select and Improve: Understanding the Mechanics of Post-Training for Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T07:14:47.302277Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2606.13125"},"observation_digest":"sha256:4a19f9269a188a3e06f4e593ca7da6deae3bb8866e69a830aea1ec5f18ad187c","observation_id":"fc408979-3023-4995-b367-ff8699d39f6a","resolution":{"observed_at":"2026-07-03T14:08:21.734036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01951/citation-record","integrity":"/paper/2412.01951/integrity","json":"/paper/2412.01951/citation-record.json","paper":"/paper/2412.01951"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T00:11:14.604915Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv:2404.14219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.604915Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:1f26900124ceec411ac751fde3494fa716487942a07469fa008a3cc1a35d23b2","observation_id":"1fb15654-2f89-4084-b60d-78fbafbc5140","resolution":{"observed_at":"2026-08-12T00:11:14.604915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.671190Z","title":null,"venue":null,"work_id":"28c7906a-8127-49d0-96dc-15bb7d984667","year":2003},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.855033Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:f38ec8eb70762f02877b5d57ff990ba28059f852a0825759c18b3b11e1b21163","observation_id":"14864a9c-3e66-4e79-9a7e-946e425a786e","resolution":{"observed_at":"2026-08-12T00:11:15.675684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T00:11:14.623071Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv:2204.05862, 2022a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.623071Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:de40ce85e9718a81a4ce6aec7db9b0d32c419f267603d2b7c9298f8312b05307","observation_id":"27f039b6-6ea1-4fda-9230-a402e54bcd7f","resolution":{"observed_at":"2026-08-12T00:11:14.623071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.603958Z","title":"J.1.2 Proof of Theorem 4.2′ Proof of Theorem 4.2′","venue":null,"work_id":"0da9c056-94e6-42be-bdb7-7a9fc2262573","year":2024},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.879283Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:04124888920cddf3a9457da1253f91069fad3d2e77fc6c5caf0b4aaf7775ece5","observation_id":"7f531f67-c03e-433f-bd4b-19dcb247b78a","resolution":{"observed_at":"2026-08-12T00:11:15.609379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-12T00:11:14.635630Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv:2407.21787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.635630Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:a48a600b33f1c1b6d4ab7351813cb8873e15c42b55b4c45d25fb90abd2753763","observation_id":"f9750400-8623-4dcb-8275-b44a276f1434","resolution":{"observed_at":"2026-08-12T00:11:14.635630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T00:11:14.652665Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.652665Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:bbb8ad1d48d9da585890e0b47303820919f56212133ddd8c65972cea668d00d7","observation_id":"a1a19f5b-306a-4106-87a7-90cc46f728b3","resolution":{"observed_at":"2026-08-12T00:11:14.652665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16730","last_updated":"2023-12-27T21:58:45Z","snapshot_observed_at":"2026-08-15T06:12:05.935323Z","submitted_at":"2023-12-27T21:58:45Z","title":"Foundations of Reinforcement Learning and Interactive Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16730","snapshot_observed_at":"2026-08-12T00:11:14.664926Z","title":"Foundations of reinforcement learning and interactive decision making","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.664926Z"},"links":{"cited_paper":"/paper/2312.16730","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:d3fd2a080423af30d71bc996da5cd5f10e1ec125973d2384654dae650eda39b5","observation_id":"de0cfaa2-1a94-4681-9f56-ce9a6e749911","resolution":{"observed_at":"2026-08-12T00:11:14.664926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-08-13T17:08:25.517069Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-08-12T00:11:14.668664Z","title":"The statistical complexity of interactive decision making","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.668664Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:973e34fc32fdac5e6f4bb03d3033729aa3b6aa0181d34e229c6626e227f497d1","observation_id":"9d41769f-0976-44c9-8b0e-c04e47963bfe","resolution":{"observed_at":"2026-08-12T00:11:14.668664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-08-13T00:22:06.602100Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-08-12T00:11:14.672865Z","title":"REBEL: Reinforcement learning via regressing relative rewards.arXiv:2404.16767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.672865Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:303a43b969426f937b005e1dbe74e781d726f4b98d097f69668bdb0f3b718e8f","observation_id":"334e2da3-8166-41b8-9891-3350675f0b0e","resolution":{"observed_at":"2026-08-12T00:11:14.672865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T00:11:14.686228Z","title":"Measuring massive multitask language understanding.arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.686228Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:f29f40fe0d9a3bd13bd0af9db3c9eadebcc0235002e523869e5829bf89084b24","observation_id":"5d599889-188e-48a1-b903-6776752e606f","resolution":{"observed_at":"2026-08-12T00:11:14.686228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-12T00:11:14.690922Z","title":"Measuring mathematical problem solving with the math dataset.arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.690922Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:d86495cd852649f013eea4728c99701a9e371a967f74a7d66119df6a1c8c7d47","observation_id":"ecca62f2-d97e-4dc6-a1f0-813308f74f10","resolution":{"observed_at":"2026-08-12T00:11:14.690922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04363","last_updated":"2024-03-13T22:48:14Z","snapshot_observed_at":"2026-08-13T05:55:18.599742Z","submitted_at":"2023-10-06T16:36:08Z","title":"Amortizing intractable inference in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04363","snapshot_observed_at":"2026-08-12T00:11:14.703729Z","title":"Amortizing intractable inference in large language models.arXiv:2310.04363,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.703729Z"},"links":{"cited_paper":"/paper/2310.04363","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:63146cb0d259aca6ac52afd8e0e2b8dee83a743ca6fffaaaadaf7ef1b07dd535","observation_id":"f99de5e0-db70-491d-a30c-3b37a29e4a47","resolution":{"observed_at":"2026-08-12T00:11:14.703729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-12T23:19:35.128993Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-12T00:11:14.707926Z","title":"Correcting the mythos of KL-regularization: Direct alignment without overparameterization via Chi-squared Preference Optimization.arXiv:2407.13399,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.707926Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:83425fb9614719a80064df8dda7e4459de8dd06e0a0ba7c53ea8424cea164ac5","observation_id":"4f835749-1798-421a-b54d-e5b277411b0a","resolution":{"observed_at":"2026-08-12T00:11:14.707926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-12T00:11:14.712014Z","title":"Large language models can self-improve.arXiv:2210.11610,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.712014Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:7c83c675c6ba304b75772fdaf4e74d3402d2a69e26b1cd8e2fa2a3d22f1029bc","observation_id":"ee9f7080-a4e1-43f1-8178-68a2f29df2df","resolution":{"observed_at":"2026-08-12T00:11:14.712014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T00:11:14.715920Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.715920Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:0ed3b8b035b25edf417962e29d61815afa5954525ceff1ee616cf493bc0259ca","observation_id":"0a225960-04a1-4a92-8e2f-a658629ba70f","resolution":{"observed_at":"2026-08-12T00:11:14.715920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-08-12T23:57:54.839711Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-12T00:11:14.724462Z","title":"Provably mitigating overoptimization in RLHF: Your SFT loss is implicitly an adversarial regularizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.724462Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:7444ae7b1eff070959d152b93fed4e021a5cd7d3104ea6d5df59b31bc1a7dc36","observation_id":"4ecb5d6a-a9cb-44b6-a322-befa3abcb542","resolution":{"observed_at":"2026-08-12T00:11:14.724462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06979","last_updated":"2024-07-29T20:51:25Z","snapshot_observed_at":"2026-08-13T10:14:24.033577Z","submitted_at":"2023-09-13T14:15:03Z","title":"Auto-Regressive Next-Token Predictors are Universal Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06979","snapshot_observed_at":"2026-08-12T00:11:14.728418Z","title":"Auto-regressive next-token predictors are universal learners.arXiv:2309.06979,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.728418Z"},"links":{"cited_paper":"/paper/2309.06979","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:a60da75176bc6afb4f6e537726a430e4e620ebd42ed52c9875c4e7b00ef83337","observation_id":"d7cea87d-19b0-4b6c-8247-e08c0aace764","resolution":{"observed_at":"2026-08-12T00:11:14.728418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02650","last_updated":"2021-01-17T09:39:46Z","snapshot_observed_at":"2026-08-13T16:21:46.888033Z","submitted_at":"2020-10-06T11:57:03Z","title":"If beam search is the answer, what was the question?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02650","snapshot_observed_at":"2026-08-12T00:11:14.732058Z","title":"If beam search is the answer, what was the question? arXiv:2010.02650,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.732058Z"},"links":{"cited_paper":"/paper/2010.02650","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:3c8e9b668c465c99e0b07000e9a5b535d9dcd017083e1f3e61a630fa8f698525","observation_id":"e9d616e4-1187-4a71-9e08-6a2ced45bf4b","resolution":{"observed_at":"2026-08-12T00:11:14.732058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17022","last_updated":"2024-06-03T20:50:26Z","snapshot_observed_at":"2026-08-13T05:40:18.452528Z","submitted_at":"2023-10-25T22:00:05Z","title":"Controlled Decoding from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17022","snapshot_observed_at":"2026-08-12T00:11:14.736440Z","title":"Controlled decoding from language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.736440Z"},"links":{"cited_paper":"/paper/2310.17022","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:02eb7e9a24342d8e6005f9df8905fd009c3ffba118b860191f641b6724bfe049","observation_id":"de860048-80a8-4c98-928b-e37c2eb7d89a","resolution":{"observed_at":"2026-08-12T00:11:14.736440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12086","last_updated":"2024-10-25T12:04:26Z","snapshot_observed_at":"2026-08-13T04:37:38.327999Z","submitted_at":"2024-01-22T16:24:43Z","title":"West-of-N: Synthetic Preferences for Self-Improving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12086","snapshot_observed_at":"2026-08-12T00:11:14.744562Z","title":"West-of-n: Synthetic preference generation for improved reward modeling.arXiv:2401.12086,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.744562Z"},"links":{"cited_paper":"/paper/2401.12086","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:30f84a2e140b030b9b3ff9b255cb8517a6316e66e8dd59c10b64249b585a5b8a","observation_id":"5a8d4734-9aa9-4cac-9a4e-e10413807cee","resolution":{"observed_at":"2026-08-12T00:11:14.744562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-08-14T07:56:53.195386Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-08-12T00:11:14.748447Z","title":"Language model self-improvement by reinforcement learning contemplation.arXiv:2305.14483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.748447Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:e5f0172c3a54739c48d5b741c102007b901c6ab1d2c2aa9497bfc470d3fdcd66","observation_id":"e0a80c5d-efc9-4ee1-ac42-e7fcbf1dbff1","resolution":{"observed_at":"2026-08-12T00:11:14.748447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04600","last_updated":"2024-07-05T15:48:34Z","snapshot_observed_at":"2026-08-12T23:28:04.853507Z","submitted_at":"2024-07-05T15:48:34Z","title":"Understanding the Gains from Repeated Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04600","snapshot_observed_at":"2026-08-12T00:11:14.752473Z","title":"Understanding the gains from repeated self-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.752473Z"},"links":{"cited_paper":"/paper/2407.04600","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:b232e0d8dc50b57b14f11e9c985f0cef9d3da5f3887650ec532d6f72a41d1905","observation_id":"4bfc5069-9fde-48bd-a408-74f5244ffb56","resolution":{"observed_at":"2026-08-12T00:11:14.752473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05012","last_updated":"2024-05-12T22:21:27Z","snapshot_observed_at":"2026-08-14T16:13:12.713069Z","submitted_at":"2024-05-08T12:26:15Z","title":"The Entropy Enigma: Success and Failure of Entropy Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05012","snapshot_observed_at":"2026-08-12T00:11:14.756635Z","title":"The entropy enigma: Success and failure of entropy minimization.arXiv:2405.05012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.756635Z"},"links":{"cited_paper":"/paper/2405.05012","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:8dfecedf1cd41726da325e2fb4eafa91ca451eebea762edc796dca7ae0e41d4b","observation_id":"87f34528-7e9e-47f8-b25f-7d3625855b21","resolution":{"observed_at":"2026-08-12T00:11:14.756635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-14T08:20:34.829087Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-12T00:11:14.760513Z","title":"Recursive introspection: Teaching language model agents how to self-improve.arXiv:2407.18219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.760513Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:f354e145d7c4ad4007e8e96e64cbcca409e6edfc55bf752503ce1267b5e861eb","observation_id":"9c566fc9-7d28-41df-b585-eb9d12e9ea1b","resolution":{"observed_at":"2026-08-12T00:11:14.760513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-08-12T23:18:24.223291Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-08-12T00:11:14.773191Z","title":"Bond: Aligning LLMs with Best-of-N distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.773191Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:d63c920909a808b24ca6a91f04440e965797d7e89ddb3a5beeb5e5c7767d56bb","observation_id":"5580a3f5-f4cf-46f6-872d-ae9f8d2da078","resolution":{"observed_at":"2026-08-12T00:11:14.773191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-12T00:11:14.777382Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters.arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.777382Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:0def3cdded1e77b9de9b769c364d9025cae589564dda8f596cfa90d0eda16286","observation_id":"b6402f5d-daae-4bb7-bf04-dab266799e55","resolution":{"observed_at":"2026-08-12T00:11:14.777382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01462","last_updated":"2024-07-16T16:51:38Z","snapshot_observed_at":"2026-08-12T23:51:25.652690Z","submitted_at":"2024-06-03T15:51:04Z","title":"The Importance of Online Data: Understanding Preference Fine-tuning via Coverage","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01462","snapshot_observed_at":"2026-08-12T00:11:14.781971Z","title":"Understanding preference fine-tuning through the lens of coverage.arXiv:2406.01462,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.781971Z"},"links":{"cited_paper":"/paper/2406.01462","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:0bb3211f58d6ce605d4e1f87313292078ffdeda6e04c8058b1e5006b76f9b280","observation_id":"d2b150d1-58cd-4487-aa4b-176f7418581f","resolution":{"observed_at":"2026-08-12T00:11:14.781971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T00:11:14.786588Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.786588Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:305c64b0bd97f816dbe8a8a3485b99bd845ff40afbc94b590339c638761bcce2","observation_id":"2cece19f-bf61-46fd-b1b8-ff72e0ce75c4","resolution":{"observed_at":"2026-08-12T00:11:14.786588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-08-14T09:05:55.324880Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-12T00:11:14.791360Z","title":"Tent: Fully test-time adaptation by entropy minimization.arXiv:2006.10726,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.791360Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:9246d4a5dab6efabb71b3de09b06d9453f909fb4f242db0cc2804d2aa9f89b8f","observation_id":"e213e65d-7b99-4c4f-99fd-08adad6f00cb","resolution":{"observed_at":"2026-08-12T00:11:14.791360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-12T23:08:15.634578Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-12T00:11:14.796547Z","title":"Self-taught evaluators.arXiv:2408.02666,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.796547Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:a765d46e93647dc14efeb495e543c7c8d48f5090e5da265ed5a7937445fe729c","observation_id":"2ecd20b6-2550-40e1-b732-f15ab39e5c62","resolution":{"observed_at":"2026-08-12T00:11:14.796547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-08-13T04:18:04.668988Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-12T00:11:14.800609Z","title":"Chain-of-thought reasoning without prompting.arXiv:2402.10200,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.800609Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:6e7b20306cdeab71cb0ed1f887c64fa08000a7b5ad0c031c3805cf256d8c5418","observation_id":"23e2b478-f42c-4ddb-a92f-465bd58563a5","resolution":{"observed_at":"2026-08-12T00:11:14.800609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-13T22:45:34.795769Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-12T00:11:14.805880Z","title":"Self-instruct: Aligning language models with self-generated instructions.arXiv:2212.10560,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.805880Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:0e408115bc6287881391c08877feb38e5da9c5f3ec5e8a5d89c95ee21dab4210","observation_id":"2f244995-23bd-4bb2-ab14-0cd4770b9397","resolution":{"observed_at":"2026-08-12T00:11:14.805880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-14T14:27:39.592405Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-12T00:11:14.810167Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta- judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.810167Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:cf2e017ed1ebf54d1bde5fec19bdcdd9f8304f011b34d000f865ae6fb0cc5ebe","observation_id":"33a550c8-070a-4b15-bf0b-f0ed9f0d6ce8","resolution":{"observed_at":"2026-08-12T00:11:14.810167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-08-12T23:52:56.673075Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-12T00:11:14.814539Z","title":"Exploratory preference optimization: Harnessing implicit Q*-approximation for sample-efficient RLHF","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.814539Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:53bc59505a6884b42cb7db9f1d58c0a8af184be297f29e338053d5ec753eaf9e","observation_id":"ea76dee6-6ef3-4b61-bfe5-e21682a2bc57","resolution":{"observed_at":"2026-08-12T00:11:14.814539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-13T04:59:12.838781Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-12T00:11:14.818560Z","title":"Gibbs sampling from human feedback: A provable KL-constrained framework for RLHF.arXiv:2312.11456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.818560Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:f741e57b044bfd760b0780c9a6cfccd5497669d75dca2ff4cc3b39e4307b685c","observation_id":"182c56cc-2c66-43db-b674-7b15889833d9","resolution":{"observed_at":"2026-08-12T00:11:14.818560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01730","last_updated":"2024-04-02T08:40:07Z","snapshot_observed_at":"2026-08-13T00:39:30.730797Z","submitted_at":"2024-04-02T08:40:07Z","title":"Asymptotics of Language Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01730","snapshot_observed_at":"2026-08-12T00:11:14.823508Z","title":"Asymptotics of language model alignment.arXiv:2404.01730,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.823508Z"},"links":{"cited_paper":"/paper/2404.01730","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:325d491af5d250abb8586d5daceeac44182cd6d8ebab5702de3fc9d5a8a6b557","observation_id":"e5212328-04eb-4a7d-ac0d-ed1f8725245c","resolution":{"observed_at":"2026-08-12T00:11:14.823508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-13T04:21:00.187589Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-08-12T00:11:14.827757Z","title":"A theoretical analysis of Nash learning from human feedback under general KL-regularized preference.arXiv:2402.07314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.827757Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:2793f024f200f146ab6616510b62daee2cb214079802bd5cad898adee75984fe","observation_id":"e98b4f2e-9bb9-48cf-aa18-cc9c55bd8095","resolution":{"observed_at":"2026-08-12T00:11:14.827757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-12T00:11:14.831684Z","title":"Self-rewarding language models.arXiv:2401.10020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.831684Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:bed2759623687bbe7b94cacac1bf28c0c503cfbd7b53ddbb78102653e8964c14","observation_id":"1fe62b64-63cb-4a12-91b6-bf7765fe99d4","resolution":{"observed_at":"2026-08-12T00:11:14.831684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.729819Z","title":null,"venue":null,"work_id":"f8ab7645-366f-4440-bb5e-889c24214b86","year":2024},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.835570Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:e6239668a9ab3c9a13bdb04a2c117847942f32f716e8b5dd53ecbf5dc10ae0d9","observation_id":"474be5c1-9b8f-4b67-8682-abe60503e6c7","resolution":{"observed_at":"2026-08-12T00:11:15.733206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.718729Z","title":"LLM-as-a-Judge","venue":null,"work_id":"0b2ec30f-0c2f-462e-95b1-915f7967a9a1","year":2022},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.839322Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:567716d41953a3a9b573eed96dfed65f75b8574873f9284247880cdb9805c4ec","observation_id":"b0004a9f-e054-467e-9568-9e911add078d","resolution":{"observed_at":"2026-08-12T00:11:15.722498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.707911Z","title":null,"venue":null,"work_id":"a865fc22-0659-4a25-8e27-8c90b64497ef","year":2020},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.843452Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:59fa41f203c33f8dd900794af3dab7c857a208ffe7aa2454fc1b3ea8323a4ca9","observation_id":"bcae0b3a-9da3-4dd5-b997-43a78a11b2a8","resolution":{"observed_at":"2026-08-12T00:11:15.711680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.695508Z","title":"More sophisticated inference-time search strategies such tree search and MCTS (Yao et al., 2024; Wan et al., 2024; Mudgal et al., 2023; Zhao et al.,","venue":null,"work_id":"9503f24b-c17c-4983-a6be-c2963c11a8b6","year":2024},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.847320Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:0de15797e6039624594d527f2570ddc04c9fcec03f6bcfc16504657dc2eda730","observation_id":"485d398b-78f6-4fdd-9fab-b7a7f7f79349","resolution":{"observed_at":"2026-08-12T00:11:15.699555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.683135Z","title":"Perhaps most closely related to our work is Frei et al","venue":null,"work_id":"a58f20f5-eb7c-4983-a903-adb15367ffcc","year":2020},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.851177Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:86c98077fd5f2b67bd6224dfa781fcaeeb85dcd6941893b5d246bf7481cd8cfd","observation_id":"d15a36d1-b38a-4be8-a229-e1d28059e7e3","resolution":{"observed_at":"2026-08-12T00:11:15.687294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.659346Z","title":"Proof of Proposition C.1","venue":null,"work_id":"9b7e892d-5f8f-446c-af63-3880bc350e09","year":1995},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.858827Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:1f8617a4f967330b77aec2774f9e1a7baa200d1082070a9183af5a07ec2d0807","observation_id":"cd1fac52-502e-41e7-9dad-ac4b99c7bc6d","resolution":{"observed_at":"2026-08-12T00:11:15.663215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.646848Z","title":"We quantify the quality of a sharpened model as follows","venue":null,"work_id":"d8addf54-7fb0-49df-b2d4-b04cbebec027","year":1995},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.863340Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:6abadec6b38e0230898da7da5f1a05bfc35e84ee30c095aeb6ac4ca35cc8aeff","observation_id":"7cdb21b2-5c02-465a-a7d3-4441a2eb07e4","resolution":{"observed_at":"2026-08-12T00:11:15.651219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.633106Z","title":"Now a⊤Γ−1 t−1a ≤ 1/λ with probability 1, where λ = λmin(Γ0)","venue":null,"work_id":"9a762215-4bc9-47ff-af4d-f4193207c9e4","year":2014},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.870651Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:92a45def110121e21830b286fff6205ec9b4eda517747ea34e748c816b03e4e4","observation_id":"43c7ee13-b33b-4892-a93f-3f6453d3e602","resolution":{"observed_at":"2026-08-12T00:11:15.637243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.619045Z","title":"Note that unlike the non-adaptive framework, the distribution overmi depends on the underlying instance I with which the algorithm interacts","venue":null,"work_id":"580579a7-a301-420f-bf79-d28e576bf9cd","year":2017},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.875258Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:4d56d911b885d8ed2418d4d7359a414f356010c740c6c25a219cfd08468b7a31","observation_id":"02465288-f85a-49e2-b606-2e43efbb3d91","resolution":{"observed_at":"2026-08-12T00:11:15.623676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.589014Z","title":null,"venue":null,"work_id":"ccada6b3-5112-44c6-8298-2e8c84dbe80b","year":2024},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.883441Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:41db6c31f6bf537139270dacab86a95bf6c3a5b7d8e133bf2acbcd3de7f1e58c","observation_id":"4f13ea1f-2315-4d54-bf2b-dd97e64c56da","resolution":{"observed_at":"2026-08-12T00:11:15.593265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.576608Z","title":"Initialize: π(1) ← πbase, D(0) ← ∅","venue":null,"work_id":"d778a834-c0bb-42be-9598-af837274fb5e","year":2024},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.887423Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:613996a500e44e780573f19880e3a91d5c559baab684c3e0a81088c0d148f1ec","observation_id":"f05ee8cb-53e6-40b7-b2b1-2996a591e203","resolution":{"observed_at":"2026-08-12T00:11:15.580691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:11:15.560008Z","title":"Also suppose thatπ⋆ β ∈ Π where π⋆ β(y | x) ∝ π1+β−1 base (y | x)","venue":null,"work_id":"09237fab-c34f-4af0-940d-4da2e8e217de","year":2016},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.891530Z"},"links":{"citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:15753b34d611696128f9b6a3c326f858742e3b0e787e49141c44b374d42ea426","observation_id":"b7cd25d5-9199-46fb-b847-93b6ad41f2f4","resolution":{"observed_at":"2026-08-12T00:11:15.566237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12875","last_updated":"2024-09-21T06:48:45Z","snapshot_observed_at":"2026-08-13T04:14:39.684680Z","submitted_at":"2024-02-20T10:11:03Z","title":"Chain of Thought Empowers Transformers to Solve Inherently Serial Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12875","snapshot_observed_at":"2026-08-12T00:11:14.720249Z","title":"Chain of thought empowers transformers to solve inherently serial problems.arXiv:2402.12875,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":1973,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.720249Z"},"links":{"cited_paper":"/paper/2402.12875","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:7b6b2c128faeabbe048e93ddba671a2cb3e289f963519a8444953976b12febd3","observation_id":"b57a37d9-567b-42a2-b260-324885c83b69","resolution":{"observed_at":"2026-08-12T00:11:14.720249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T00:11:14.740875Z","title":"GPT-4 technical report.arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.740875Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:023db945130afc2d14ef3dcd0d9ecaa1601581800790bfe2915998cf799a5eed","observation_id":"100ba0b1-6cce-431d-ad6d-aa9ddcc9f180","resolution":{"observed_at":"2026-08-12T00:11:14.740875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09053","last_updated":"2024-05-04T19:52:03Z","snapshot_observed_at":"2026-08-14T01:39:12.748547Z","submitted_at":"2024-03-14T02:42:19Z","title":"Towards a theory of model distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09053","snapshot_observed_at":"2026-08-12T00:11:14.631474Z","title":"Towards a theory of model distillation.arXiv preprint arXiv:2403.09053,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.631474Z"},"links":{"cited_paper":"/paper/2403.09053","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:8aa5755a54536d4a2e5a91a33b90714ddd957b87a2477abf09276e0ecc0db0ad","observation_id":"fbbf4766-f474-43ae-a5f0-3e499cdf04bf","resolution":{"observed_at":"2026-08-12T00:11:14.631474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11428","last_updated":"2023-10-17T17:39:40Z","snapshot_observed_at":"2026-08-13T05:47:25.339219Z","submitted_at":"2023-10-17T17:39:40Z","title":"Butterfly Effects of SGD Noise: Error Amplification in Behavior Cloning and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11428","snapshot_observed_at":"2026-08-12T00:11:14.627241Z","title":"Butterfly effects of SGD noise: Error amplification in behavior cloning and autoregression.arXiv:2310.11428,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.627241Z"},"links":{"cited_paper":"/paper/2310.11428","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:7965332f38292bd39499b6ab4519ce7d702893645e0e675b82239f09327e0fc1","observation_id":"1fa65628-c83b-4a35-a0b8-504f9e4fc9bb","resolution":{"observed_at":"2026-08-12T00:11:14.627241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-12T23:52:06.447877Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-12T00:11:14.681741Z","title":"BoNBoN alignment for large language models and the sweetness of best-of-n sampling.arXiv:2406.00832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.681741Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:cb1229d53c89ded7a258e0c39f77ac94255faff0853e5d110a23ec43496aa690","observation_id":"f23a1978-c153-4140-af44-9127a7b0e72f","resolution":{"observed_at":"2026-08-12T00:11:14.681741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-15T08:59:30.302596Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-12T00:11:14.640335Z","title":"Self-play fine-tuning converts weak language models to strong language models.arXiv:2401.01335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.640335Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:ff35734359c461e5dbb91f1134371cd596b53ee49e7c4be7dee24e74143d7f14","observation_id":"c5642192-9f09-4e58-9c3c-65b637a8bb1f","resolution":{"observed_at":"2026-08-12T00:11:14.640335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06329","last_updated":"2021-04-19T17:59:03Z","snapshot_observed_at":"2026-08-13T20:29:52.404754Z","submitted_at":"2021-01-15T23:29:57Z","title":"In Defense of Pseudo-Labeling: An Uncertainty-Aware Pseudo-label Selection Framework for Semi-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06329","snapshot_observed_at":"2026-08-12T00:11:14.764758Z","title":"In defense of pseudo-labeling: An uncertainty-aware pseudo-label selection framework for semi-supervised learning.arXiv:2101.06329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.764758Z"},"links":{"cited_paper":"/paper/2101.06329","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:9f77072ce7ea498855309545eeb0e60fe2c0ba5db2441ac75620baacb50fcde4","observation_id":"c9870b06-ed88-4bdf-8ac6-0216350d89f4","resolution":{"observed_at":"2026-08-12T00:11:14.764758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-12T00:11:14.677287Z","title":"Palm 2 technical report.arXiv:2305.10403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.677287Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:7e1237444f06054a570059d9531a93261423399d1820eb7265808b08a85cc5e3","observation_id":"645a2964-83fb-4947-b139-d1a25cb4b978","resolution":{"observed_at":"2026-08-12T00:11:14.677287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T00:11:14.699627Z","title":"Lora: Low-rank adaptation of large language models.arXiv:2106.09685,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.699627Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:810f4598befc6f4e58449c00d8655bd11d46f9b4a6652492f9240c8688c6c51c","observation_id":"0308ba6c-f907-459d-a12b-5da8b4789a63","resolution":{"observed_at":"2026-08-12T00:11:14.699627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T00:11:14.768719Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.768719Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:4a6dd5f83416485e6c92245ad3bcf7bccac7da3e21d51e8a9734be04136525d4","observation_id":"76e57ec9-04a5-4467-86ee-0c576f8db4f9","resolution":{"observed_at":"2026-08-12T00:11:14.768719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T00:11:14.644344Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.644344Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:3006dfbe3e0c4319c0b33deb1c186ad5850c3383641633f99e62f176dc500192","observation_id":"a668f288-be40-42d7-9f6d-5f541cebedfa","resolution":{"observed_at":"2026-08-12T00:11:14.644344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01255","last_updated":"2019-10-02T23:53:39Z","snapshot_observed_at":"2026-08-14T10:29:12.725271Z","submitted_at":"2019-10-02T23:53:39Z","title":"Distillation $\\approx$ Early Stopping? Harvesting Dark Knowledge Utilizing Anisotropic Information Retrieval For Overparameterized Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01255","snapshot_observed_at":"2026-08-12T00:11:14.656592Z","title":"Distillation≈ early stopping? Harvesting dark knowledge utilizing anisotropic information retrieval for overparameterized neural network.arXiv:1910.01255,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.656592Z"},"links":{"cited_paper":"/paper/1910.01255","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:657eaf90e58945790e7b73c444da553846912924a110121ddd0481c6b03aff1c","observation_id":"8f21e54c-60e5-48c2-8b3b-6e81dd482993","resolution":{"observed_at":"2026-08-12T00:11:14.656592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:11:14.660901Z","title":"The llama 3 herd of models.arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.660901Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:e49854d4a4befa0246df7402e88182b68897ea8eca96f5f397c6f24aa6e1ca2f","observation_id":"b84f714c-230d-40f4-acba-d4382f15c153","resolution":{"observed_at":"2026-08-12T00:11:14.660901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06057","last_updated":"2025-03-04T14:33:50Z","snapshot_observed_at":"2026-08-12T23:26:38.161586Z","submitted_at":"2024-07-08T15:59:44Z","title":"Variational Best-of-N Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06057","snapshot_observed_at":"2026-08-12T00:11:14.618718Z","title":"Variational best-of-n alignment.arXiv:2407.06057,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.618718Z"},"links":{"cited_paper":"/paper/2407.06057","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:a3d7a51fb22c50d33c53bbbc427abc15c416ddae7f2dcd2dbab0f5db519b4d8d","observation_id":"d7948727-c316-488a-b7bc-9d176cc9fae7","resolution":{"observed_at":"2026-08-12T00:11:14.618718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T00:11:14.695697Z","title":"Distilling the knowledge in a neural network.arXiv:1503.02531,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.695697Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:47c6c98d613862ebc6a116880c5454f14cca15ccda3449b5f691726db7a1c6b0","observation_id":"9489302e-5150-489d-8ff0-5969331fd422","resolution":{"observed_at":"2026-08-12T00:11:14.695697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-13T20:43:53.414882Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-08-12T00:11:14.614276Z","title":"Towards understanding ensemble, knowledge distillation and self-distillation in deep learning.arXiv:2012.09816,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.614276Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:77ad3a9ba0f90e08ae745faae814a69c46ba945f848c93150384a62e04adf04d","observation_id":"b33b96a4-3cf4-41af-84b2-d8c087597fa8","resolution":{"observed_at":"2026-08-12T00:11:14.614276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11206","last_updated":"2025-05-07T19:12:46Z","snapshot_observed_at":"2026-08-12T23:41:27.541146Z","submitted_at":"2024-06-17T04:53:47Z","title":"Retraining with Predicted Hard Labels Provably Increases Model Accuracy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11206","snapshot_observed_at":"2026-08-12T00:11:14.648794Z","title":"Retraining with predicted hard labels provably increases model accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.648794Z"},"links":{"cited_paper":"/paper/2406.11206","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:5c5a4604d7b01ab6a2dbe5d7a1ad10b8ea6a1622d326732f80c13a9d58f63e72","observation_id":"8bbafa47-6fa0-4958-8e87-dfad73cd2737","resolution":{"observed_at":"2026-08-12T00:11:14.648794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.00555","last_updated":"2020-10-04T19:57:06Z","snapshot_observed_at":"2026-08-15T05:08:36.760574Z","submitted_at":"2020-05-31T16:34:08Z","title":"Transferring Inductive Biases through Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.00555","snapshot_observed_at":"2026-08-12T00:11:14.609911Z","title":"Transferring inductive biases through knowledge distillation","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:14.609911Z"},"links":{"cited_paper":"/paper/2006.00555","citing_paper":"/paper/2412.01951"},"observation_digest":"sha256:c22dd3d240d7e34c17d127c8f003c0e0cf27d426b2dd9ba00e4f09678761c153","observation_id":"58aa67ff-9efd-4d3b-beea-8186a5fb3bec","resolution":{"observed_at":"2026-08-12T00:11:14.609911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 16 inbound Pith citation observations for arXiv:2412.01951."}