{"as_of":"2026-08-09T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bf10d3de942731052cf5c6a61e1c5c8975a237b8a18d17a866cbe9c67d7d07d","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:25:28.508547Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:02:07.425724Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:49:40.779767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2509.01649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01649","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilled pretraining: A modern lens of data, in-context learning and test-time scaling","venue":null,"work_id":"fd87a060-fe25-45a0-a3be-c230492b9d97","year":2025},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2509.01649","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:98eb4bfa6eaf0ce4ae1fd326e41e425e6e7421f1a5207ea2a3b2840d2327f0dd","observation_id":"04476116-ecc1-4122-944c-2d0c395bdfa6","resolution":{"observed_at":"2026-05-14T19:12:24.696963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2509.01649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01649","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilled pretraining: A modern lens of data, in-context learning and test-time scaling","venue":null,"work_id":"fd87a060-fe25-45a0-a3be-c230492b9d97","year":2025},"citing_paper":{"arxiv_id":"2605.20948","last_updated":"2026-05-20T09:35:04Z","snapshot_observed_at":"2026-07-06T23:31:27.989406Z","submitted_at":"2026-05-20T09:35:04Z","title":"Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T05:49:14.789955Z"},"links":{"cited_paper":"/paper/2509.01649","citing_paper":"/paper/2605.20948"},"observation_digest":"sha256:bb17c5da63d77438679adb0d5c562fe3024e250af607d36eafe4fe686004ac43","observation_id":"bc6c8d4f-1d84-421f-85d3-a20dac254e15","resolution":{"observed_at":"2026-05-21T05:49:40.781393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01649","snapshot_observed_at":"2026-08-01T03:02:07.425724Z","title":"Distilled","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-08T08:44:07.330246Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:07.425724Z"},"links":{"cited_paper":"/paper/2509.01649","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:0ced7db6fb8059f83ea48d46614e57c74968c1b33efe1d8c118bdac195932672","observation_id":"fb3df0d2-ba17-40a7-98f1-6e64c0bf2d94","resolution":{"observed_at":"2026-08-01T03:02:07.425724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01649/citation-record","integrity":"/paper/2509.01649/integrity","json":"/paper/2509.01649/citation-record.json","paper":"/paper/2509.01649"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:22.958457Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:22.958457Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:6d1eaefc36f6a7a425feb7b6d270f20d8ce44e42003a0e41e3e4a74e5d442b3f","observation_id":"bebfc12a-0e3c-4625-95a5-75834a84312f","resolution":{"observed_at":"2026-08-05T12:25:22.958457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:23.019471Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.019471Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:86f47a9795bfe3b27affee8055b36bfb63c9ce6897cc31f88fd2d9d2c164c2bf","observation_id":"170ad7b5-b0ea-44cd-8d91-ef4ff033c4fa","resolution":{"observed_at":"2026-08-05T12:25:23.019471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:23.125793Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.125793Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:56b311ab578483419f87b3090b8ac2b7945dd97ae26506fb08ca364d7a289352","observation_id":"f6ef6a1f-07ce-4a2a-9ca5-c55a343986d3","resolution":{"observed_at":"2026-08-05T12:25:23.125793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:23.209699Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.209699Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:c56b175be19206fb7c1b80bdadcaae402a220ab7974ff25f0b50aecb14a0313a","observation_id":"73c6fc5c-8d25-41fa-a7e3-621d5c5e05e2","resolution":{"observed_at":"2026-08-05T12:25:23.209699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.873832Z","title":null,"venue":null,"work_id":"876f3d76-e4be-4e53-bf5e-edcf7981ce23","year":null},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.286873Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:b99e914c5b80a10f680660ee8c49fbd8b42ad908ffc5f59e483d9fcebc7af652","observation_id":"f9d525d0-7efe-4c5a-8840-c8115731ff7a","resolution":{"observed_at":"2026-08-05T12:25:29.878023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-05T12:25:23.384000Z","title":"On-policy distillation of language models: Learning from self-generated mistakes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.384000Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:7bae05ae24c65ebf11ec0c67011bcb8e18c8c88c694d8ed89d616b5b350677e2","observation_id":"13ee03da-a6ba-4052-8e00-1052b8bd690e","resolution":{"observed_at":"2026-08-05T12:25:23.384000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.859624Z","title":"Alphaevolve: A gemini-powered coding agent for designing advanced algorithms, 2025","venue":null,"work_id":"fe2a7c9b-12d1-41bb-a8c1-11b38094e25b","year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.494428Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:7114db7a7660dc3dfc7a4bb0bc2f1cabe392f6809f8560d9e361082e05e62cca","observation_id":"0f4d3823-fe0f-494b-b090-8a614bc9f5fc","resolution":{"observed_at":"2026-08-05T12:25:29.864076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-05T12:25:23.571192Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.571192Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:f6f9250caf0471d435f9660498c231f0d9e62fb36e294ac46da0c5337911cd06","observation_id":"b877d89e-b5d5-443a-b6d2-bdf26a6d18a4","resolution":{"observed_at":"2026-08-05T12:25:23.571192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.844941Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":"432bb641-ad1e-4add-bb2f-a143107e7287","year":2023},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.667642Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:ad5603b3520862888a6ff992e4cacba4c193318cc740abcf239fffa82f7b31c9","observation_id":"7a7d6cf2-48c2-4210-b588-804baacad62c","resolution":{"observed_at":"2026-08-05T12:25:29.849538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:23.760335Z","title":"Do deep nets really need to be deep? Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.760335Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:4071797866ea2f252647453b9b9e8bae508d3aa080440bf6f9fa477ef5e300c0","observation_id":"d9d4f780-ffd3-4fc5-b148-a943f3ff6a63","resolution":{"observed_at":"2026-08-05T12:25:23.760335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.818289Z","title":"Scaling test-time compute with open models, 2024","venue":null,"work_id":"4814c4bb-9f0a-4c34-85a8-fcb792d7443a","year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.842264Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:db924150f6865897c830be03c23d545fe8dc9078fa97451d15802c1441731d7c","observation_id":"37f6152d-fbcd-4502-9ded-cd4546b6deb2","resolution":{"observed_at":"2026-08-05T12:25:29.824431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05237","last_updated":"2022-06-21T09:46:14Z","snapshot_observed_at":"2026-08-07T22:53:34.251061Z","submitted_at":"2021-06-09T17:20:40Z","title":"Knowledge distillation: A good teacher is patient and consistent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05237","snapshot_observed_at":"2026-08-05T12:25:23.941000Z","title":"Knowledge distillation: A good teacher is patient and consistent, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:23.941000Z"},"links":{"cited_paper":"/paper/2106.05237","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:328034a1ef8238149395ba571e6050eddb8a813db3473de0c308ac2c4ec18beb","observation_id":"e31731bc-8330-4580-aa69-80e800748b77","resolution":{"observed_at":"2026-08-05T12:25:23.941000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.802940Z","title":"Birth of a transformer: A memory viewpoint","venue":null,"work_id":"5b127266-b553-43d6-bb5a-fe054c161892","year":2023},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.039161Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:856af66ae1b9ca04868c688a592bd4149411afc6e4feb6cff95b5557c738b93e","observation_id":"d4477826-47e3-49cd-bffa-20fb3c8a19ee","resolution":{"observed_at":"2026-08-05T12:25:29.808008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:24.111826Z","title":"Model compression","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.111826Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:fa37c6ed69e0bea40093cbebade101f640f413e90d3641b36f6175e313601a79","observation_id":"88af22cc-8883-4c65-8514-7f7a59104101","resolution":{"observed_at":"2026-08-05T12:25:24.111826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08606","last_updated":"2025-07-25T16:55:43Z","snapshot_observed_at":"2026-08-08T04:26:43.927211Z","submitted_at":"2025-02-12T17:52:47Z","title":"Distillation Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08606","snapshot_observed_at":"2026-08-05T12:25:24.197937Z","title":"Distillation scaling laws, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.197937Z"},"links":{"cited_paper":"/paper/2502.08606","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:c7922e58045dafd627df7441adc3d1da5e164340924f3182fc6be17ad3eb919c","observation_id":"d9287584-c60c-4e1f-b10f-1b5121db1396","resolution":{"observed_at":"2026-08-05T12:25:24.197937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13111","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.528231Z","title":"Why knowledge distillation works in generative models: A minimal working explanation","venue":null,"work_id":"d6896047-3956-47dc-9efa-9a40241d402f","year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.290047Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:531366d438e18bf75a35e9382801f735883af32d674b824e7c03a44c194cc2ef","observation_id":"13688017-0268-4d3b-aba3-de9cf28eacea","resolution":{"observed_at":"2026-08-05T12:25:29.535717Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:24.382110Z","title":"Rethinking fine-tuning when scaling test-time compute: Limiting confidence improves mathematical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.382110Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:a9785a58771a28963c9ad924a3c82693d27fb85784bb64b4e1c3bc6b92a0b67e","observation_id":"8a84ea49-d432-49ff-813d-59b1cf6abef4","resolution":{"observed_at":"2026-08-05T12:25:24.382110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-08T14:49:36.757543Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-05T12:25:24.465741Z","title":"Alphamath almost zero: Process supervision without process, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.465741Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:c388b1c117ffd7a05d5adadf349b7835f39c6991c506958d4c5ff8cc1bd77eeb","observation_id":"3751ea62-5e02-48cc-bd39-ce387294c4a2","resolution":{"observed_at":"2026-08-05T12:25:24.465741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01348","last_updated":"2019-10-03T08:14:13Z","snapshot_observed_at":"2026-08-02T07:45:28.770241Z","submitted_at":"2019-10-03T08:14:13Z","title":"On the Efficacy of Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01348","snapshot_observed_at":"2026-08-05T12:25:24.562713Z","title":"On the efficacy of knowledge distillation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.562713Z"},"links":{"cited_paper":"/paper/1910.01348","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:360b2fa2fb34236288c48ad6a12f2d3705f2e3af68f36ca14d5264412a5de365","observation_id":"bd39482b-8f99-48b4-b476-9d495338e925","resolution":{"observed_at":"2026-08-05T12:25:24.562713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:24.661688Z","title":"Inference-aware fine-tuning for best-of-n sampling in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.661688Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:644d65026a32b7ac16daa78534bb535b803f9fd15372210302a97c9faa59fbc2","observation_id":"868e1558-4f58-4504-a633-676f96595b73","resolution":{"observed_at":"2026-08-05T12:25:24.661688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T12:25:24.753080Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.753080Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:57231dc134883b71722a8a045d08083d42ec1a33e61cca180c2d640f922fc424","observation_id":"8c19ebc7-857c-426c-9bde-ab3eaeeee94c","resolution":{"observed_at":"2026-08-05T12:25:24.753080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:24.878084Z","title":"Weight ensembling improves reasoning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:24.878084Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:dadc84dd6edbb9fa42b85b7b3566375bf49859bcdb715b1004f5cdef2d57df3e","observation_id":"40bcfe5b-aacf-4f6e-8f25-f3186fb1aa5e","resolution":{"observed_at":"2026-08-05T12:25:24.878084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.778504Z","title":"DROP : A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"59235f1e-9128-4262-8a82-4eeaa5ad32a4","year":2019},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.003825Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:4936941156c52b1cd0a385dd58bc8aef469251898eacabaf16433c3c3c514518","observation_id":"2331a9c0-d643-47c0-a4e9-eeb4b0349675","resolution":{"observed_at":"2026-08-05T12:25:29.782758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11004","last_updated":"2024-02-16T18:28:36Z","snapshot_observed_at":"2026-08-03T19:49:17.673100Z","submitted_at":"2024-02-16T18:28:36Z","title":"The Evolution of Statistical Induction Heads: In-Context Learning Markov Chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11004","snapshot_observed_at":"2026-08-05T12:25:25.085058Z","title":"Edelman, Ezra Edelman, Surbhi Goel, Eran Malach, and Nikolaos Tsilivis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.085058Z"},"links":{"cited_paper":"/paper/2402.11004","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:0bcee7c158226eeadc87c16cb5258c73a1475db4e7dcd915a2c2b83c98f0e8b1","observation_id":"3162a577-bca9-4c0a-891f-828d349a23c3","resolution":{"observed_at":"2026-08-05T12:25:25.085058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.764324Z","title":"Born again neural networks","venue":null,"work_id":"328d3c8e-42ea-4784-ae12-f76eb17d0daf","year":2018},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.189309Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:e39a37437a580c6844e7549104abdb918027304a6375d1e2ddee5b886ddf0589","observation_id":"0b7e0d21-d7d3-4292-833c-b36f0f938a44","resolution":{"observed_at":"2026-08-05T12:25:29.768885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T12:25:25.292590Z","title":"The P ile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.292590Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:e26500af15733be7b621a70ac0e9ba7a55c659acdc506094e4c97a618d7b879f","observation_id":"7740d992-e655-4e5b-bcf1-92634caac227","resolution":{"observed_at":"2026-08-05T12:25:25.292590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T12:25:25.407357Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.407357Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d5edd0f2148863be341203822346e61ada4528615104bdf456b141c88f82ea94","observation_id":"63fa1951-723a-4c0d-b665-b4b1e524d4a2","resolution":{"observed_at":"2026-08-05T12:25:25.407357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T12:25:25.533802Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.533802Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:11d32dfc0e8ba47f5f0f4c47dae4b345f836a1b9566b3e390454ce85a0e06be7","observation_id":"15800d26-2908-495b-b1a6-dc7e07adcffe","resolution":{"observed_at":"2026-08-05T12:25:25.533802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10518","last_updated":"2025-05-15T17:25:03Z","snapshot_observed_at":"2026-08-07T22:03:26.941475Z","submitted_at":"2025-05-15T17:25:03Z","title":"Multi-Token Prediction Needs Registers","version":1},"cited_work":{"arxiv_id":"2505.10518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.10518","snapshot_observed_at":"2026-08-05T12:25:29.113950Z","title":"Multi-Token Prediction Needs Registers","venue":"cs.CL","work_id":"4b7ac55e-f144-4e9f-8abc-d6eac1d58efc","year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.612205Z"},"links":{"cited_paper":"/paper/2505.10518","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d129370414cb7e815e150c99484058566d5de4b104af40f96851356d6cac0d54","observation_id":"efb07af1-884e-43c0-9ec7-f8dbe9355320","resolution":{"observed_at":"2026-08-05T12:25:29.120281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-05T12:25:25.693098Z","title":"Better & faster large language models via multi-token prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.693098Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d34f685a00908858853556d30ae6350366da46fb25f6ac9cc9b65802d7923f52","observation_id":"c07f773e-84fc-4187-a908-a2a26fe6a00a","resolution":{"observed_at":"2026-08-05T12:25:25.693098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.750483Z","title":"Knowledge distillation: A survey","venue":null,"work_id":"918b88a7-6376-4d5c-ac6f-4cd9239f05aa","year":2021},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.826857Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:ada0e0fe53d4189b925a0c320bb28b402e8da17064e82ed6e6036ffc1d471bcc","observation_id":"916976b7-535c-48aa-a155-adb098a62325","resolution":{"observed_at":"2026-08-05T12:25:29.754807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10796","last_updated":"2025-04-21T10:19:21Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:57:09Z","title":"Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10796","snapshot_observed_at":"2026-08-05T12:25:25.983146Z","title":"Zico Kolter, and Aditi Raghunathan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:25.983146Z"},"links":{"cited_paper":"/paper/2410.10796","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:03040362882ee52e724b16142c0364f488bd14461780ef878986fa903ec102bb","observation_id":"950d04fa-88ce-495d-9437-76ff921952f3","resolution":{"observed_at":"2026-08-05T12:25:25.983146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17215","last_updated":"2025-03-19T00:03:30Z","snapshot_observed_at":"2026-08-01T16:26:33.917672Z","submitted_at":"2024-10-22T17:40:32Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17215","snapshot_observed_at":"2026-08-05T12:25:26.071158Z","title":"Miniplm: Knowledge distillation for pre-training language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.071158Z"},"links":{"cited_paper":"/paper/2410.17215","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:df5e853f211b8d8f6beda184ecba3ed1d5eb4c9f1e3a9714cc454bc85df73b31","observation_id":"a16dd5d6-37af-4f07-bb5b-3bcafd78c977","resolution":{"observed_at":"2026-08-05T12:25:26.071158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-09T02:57:31.005115Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-05T12:25:26.151714Z","title":"Openthoughts: Data recipes for reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.151714Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d6ba5f819009834679866896a0b06fad5005bc834b44fd4dc1e02df1cf0429ab","observation_id":"e3603938-50c9-446d-9107-271dc73a8ef6","resolution":{"observed_at":"2026-08-05T12:25:26.151714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T12:25:26.237527Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.237527Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:fcc3f91a759949e0a6399d929c7ef6a1934c8c979bddd02f9b2ebcef288689c5","observation_id":"6a2fbe04-2c5c-4787-8fd7-a197b2a4f0e3","resolution":{"observed_at":"2026-08-05T12:25:26.237527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.735585Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack, 2024","venue":null,"work_id":"0d4f3b0a-9c0d-4021-880d-986a4b047641","year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.317897Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d5b8dab84928925bfd5328cca2e3f787b54e5546fb477db9c11f87f29b92a703","observation_id":"319d01d5-180e-4cec-b10a-5bd0d5c4394d","resolution":{"observed_at":"2026-08-05T12:25:29.740240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:26.460696Z","title":"RACE : Large-scale R e A ding comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.460696Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:a52299eef237e1c0b2cb16cddf3e52683277c7c8487d49d502f60e3f38359c39","observation_id":"9b800b41-3613-4b6f-94ae-bf1e4b6442ab","resolution":{"observed_at":"2026-08-05T12:25:26.460696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-05T12:25:26.534257Z","title":"Datacomp-lm: In search of the next generation of training sets for language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.534257Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:a9c2c4830f81fe7614188e7994284522b283973f975255f0e6ab2fc70ebcf958","observation_id":"8f8129e7-95e5-4f7f-bfa2-116c3889867b","resolution":{"observed_at":"2026-08-05T12:25:26.534257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11295","last_updated":"2021-09-23T11:02:24Z","snapshot_observed_at":"2026-08-09T11:47:25.385234Z","submitted_at":"2021-09-23T11:02:24Z","title":"Dynamic Knowledge Distillation for Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":"2109.11295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.11295","snapshot_observed_at":"2026-08-05T12:25:28.994544Z","title":"Dynamic Knowledge Distillation for Pre-trained Language Models","venue":"cs.CL","work_id":"4e30ea1c-c938-4c2f-920c-8817596926b7","year":2021},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.646130Z"},"links":{"cited_paper":"/paper/2109.11295","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:839a5b47c5a6ebdf77f35c57df2d916c3b9950bd1e1163a6ea96f855a498d607","observation_id":"d1bfaa4f-9ee2-4737-9226-6586500a26b9","resolution":{"observed_at":"2026-08-05T12:25:28.999083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20379","last_updated":"2025-02-27T18:53:30Z","snapshot_observed_at":"2026-08-07T17:41:57.954191Z","submitted_at":"2025-02-27T18:53:30Z","title":"Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20379","snapshot_observed_at":"2026-08-05T12:25:26.743517Z","title":"McIlraith, and Yilun Du","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.743517Z"},"links":{"cited_paper":"/paper/2502.20379","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:754b57b94492ffc71def444bdd8d5774b0c230e5f68efc45e0833d1f9a258a6a","observation_id":"75528aac-f872-4454-b9ca-66c4769d2145","resolution":{"observed_at":"2026-08-05T12:25:26.743517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T12:25:26.814614Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.814614Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:ae2cdc9e5666c33285b15c4a17de578c30fb5356d1a66d3b2e235fbce783d183","observation_id":"da525c05-8ae1-47c4-afa0-52d6583dfb8e","resolution":{"observed_at":"2026-08-05T12:25:26.814614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-02T16:52:38.363314Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-05T12:25:26.957355Z","title":"Program induction by rationale generation : Learning to solve and explain algebraic word problems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:26.957355Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:c2a1d37197e5f0f0b167f3750fb50fff21c6dcb6f25c2a3852bfd04c59fec87d","observation_id":"1dfec237-e73a-4b93-9c3c-da7387c8bdb7","resolution":{"observed_at":"2026-08-05T12:25:26.957355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03643","last_updated":"2016-02-26T02:21:52Z","snapshot_observed_at":"2026-07-06T04:36:10.443201Z","submitted_at":"2015-11-11T20:27:54Z","title":"Unifying distillation and privileged information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03643","snapshot_observed_at":"2026-08-05T12:25:27.075470Z","title":"Unifying distillation and privileged information","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.075470Z"},"links":{"cited_paper":"/paper/1511.03643","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:e20cd37742891b22ee15f9c4b3c6975e2adecd237584fd507b2eebaaac3a279b","observation_id":"f66d842b-8d0d-4730-8b0f-226a3dbc9704","resolution":{"observed_at":"2026-08-05T12:25:27.075470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.721007Z","title":"Fineweb-edu: the finest collection of educational content, 2024","venue":null,"work_id":"a95f4f3c-868d-4a49-9f74-7d35ea6fc260","year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.160458Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:c114b77354e99a5addb433d403e948e12fc7576a8c3c787b7e2f4f51bc4fc364","observation_id":"11ea56a0-aa12-4035-9a03-e35ba87fecee","resolution":{"observed_at":"2026-08-05T12:25:29.725818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.706186Z","title":"A statistical perspective on distillation","venue":null,"work_id":"14f3bec4-730d-4d2f-a35c-e58f927ee1bc","year":2021},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.208168Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:3704b54149a8c33702bb0c8be5715b25d518487c47ff72de93e95fb90b71d465","observation_id":"c30b19de-14d5-441a-bb7b-ba5a9fbb23a2","resolution":{"observed_at":"2026-08-05T12:25:29.711070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.690877Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"aaee5aee-47bc-441f-8cbe-c3264097c1c7","year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.320379Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:4a5fdbc362d4b901684cdfd744baa39af37cf75663b9b35f9be437307df37999","observation_id":"a0767308-b056-4601-8786-1bf4d746dc22","resolution":{"observed_at":"2026-08-05T12:25:29.695815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.672823Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"5709b55e-2526-42c4-a145-711c0578eb98","year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.424089Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:4fc032bbdc294ab2bdba9c733937f326685089413cf5dbcdbed7cb49c0790050","observation_id":"b85ab490-80ee-40a4-a470-343191edce28","resolution":{"observed_at":"2026-08-05T12:25:29.678919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.03393","last_updated":"2019-12-17T01:11:13Z","snapshot_observed_at":"2026-07-06T07:32:06.461067Z","submitted_at":"2019-02-09T09:06:01Z","title":"Improved Knowledge Distillation via Teacher Assistant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.03393","snapshot_observed_at":"2026-08-05T12:25:27.560427Z","title":"Improved knowledge distillation via teacher assistant, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.560427Z"},"links":{"cited_paper":"/paper/1902.03393","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:1a053134f4b22cffa9fad73145118ce53720c023285032cde5e8cc36fb474901","observation_id":"557e08d9-99b3-4932-9822-923375655c2b","resolution":{"observed_at":"2026-08-05T12:25:27.560427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.658456Z","title":"Improved knowledge distillation via teacher assistant","venue":null,"work_id":"be5b5bd7-9565-4cda-a7fa-1e9e6ecb8238","year":2020},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.725332Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d5b876c8882139de4aadd4afe16729e997a4032b2148b79f70a9e13f31048806","observation_id":"905b4434-242f-48ea-a140-62e4deacf45c","resolution":{"observed_at":"2026-08-05T12:25:29.662757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05715","last_updated":"2020-10-26T17:29:22Z","snapshot_observed_at":"2026-08-06T23:15:12.564262Z","submitted_at":"2020-02-13T18:56:06Z","title":"Self-Distillation Amplifies Regularization in Hilbert Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05715","snapshot_observed_at":"2026-08-05T12:25:27.847217Z","title":"Bartlett","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.847217Z"},"links":{"cited_paper":"/paper/2002.05715","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:3728676e14e4ca307456fff1867e5e0ab2ada9f9d59d28ecc9378496fb41ece5","observation_id":"8e753b6c-bbe5-4a56-bbd5-639b7da58a5c","resolution":{"observed_at":"2026-08-05T12:25:27.847217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T12:25:27.955742Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:27.955742Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:9ebfa9e25f279eb08b332538ee081860e2723a668dfe9fbbc6ef781bfd7b2b8f","observation_id":"ad9e1f80-2dc3-4368-91a8-1417616395fd","resolution":{"observed_at":"2026-08-05T12:25:27.955742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12923","last_updated":"2024-03-18T20:15:51Z","snapshot_observed_at":"2026-07-06T14:46:02.951905Z","submitted_at":"2023-01-30T14:25:02Z","title":"On student-teacher deviations in distillation: does it pay to disobey?","version":3},"cited_work":{"arxiv_id":"2301.12923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12923","snapshot_observed_at":"2026-08-05T12:25:28.864065Z","title":"On student-teacher deviations in distillation: does it pay to disobey?","venue":"cs.LG","work_id":"442a5d78-5123-42fd-bcd9-55ae511b4358","year":2023},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.121806Z"},"links":{"cited_paper":"/paper/2301.12923","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:6cc428cf05a08edf0d9002eeda828fb9c4308772e4c21e3f34c5e235fb176fe3","observation_id":"4abc85d8-de09-4335-b395-1adace19a8e8","resolution":{"observed_at":"2026-08-05T12:25:28.870109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15266","last_updated":"2025-08-28T19:09:57Z","snapshot_observed_at":"2026-08-07T16:00:30.607580Z","submitted_at":"2025-04-21T17:47:46Z","title":"Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15266","snapshot_observed_at":"2026-08-05T12:25:28.192200Z","title":"Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.192200Z"},"links":{"cited_paper":"/paper/2504.15266","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d6864070891cba27debce726be6425571c0c7c5692fd480ec85748434d41e171","observation_id":"f0d95de9-d0a1-4a0b-930c-063cb50ab965","resolution":{"observed_at":"2026-08-05T12:25:28.192200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.644830Z","title":"Github code dataset, 2022","venue":null,"work_id":"fe823d54-d2e3-4445-8cbb-aef7d927bd36","year":2022},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.300845Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:602d3f43475eae3e219a469ddc037a9677cdc0673e76a7aace9bad3d30dc3ddc","observation_id":"17dc5935-242b-443f-80fa-80f87e8db6ee","resolution":{"observed_at":"2026-08-05T12:25:29.649243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-05T12:25:28.393471Z","title":"In-context learning and induction heads, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.393471Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:a404ff9c0e099dd8a908b07702c3b00ee070422e4799051e1ad8c970a872577e","observation_id":"3b8cad1c-5e9b-4692-a04e-fd7d04d2e1d5","resolution":{"observed_at":"2026-08-05T12:25:28.393471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.630758Z","title":"Towards understanding knowledge distillation","venue":null,"work_id":"6e61271e-c438-441a-aa8e-1f726b37b5d6","year":2019},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.453398Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:137e56416bd8775b995d28212143554d24064a9674ff54b90346dfab5be2ab5a","observation_id":"1024990e-3795-47dc-8873-a393f8cc9b43","resolution":{"observed_at":"2026-08-05T12:25:29.635210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:29.614834Z","title":"Knowledge distillation performs partial variance reduction","venue":null,"work_id":"63736659-b1ea-4ec3-ba88-c25d458ecfee","year":2023},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.458085Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:121cb026b47f868d6530998cffd2e5b19e0e62cfc539204a2d91bd8b22cc8742","observation_id":"e5f48848-06da-4b1d-9e02-33e09e48f46b","resolution":{"observed_at":"2026-08-05T12:25:29.619969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01557","last_updated":"2019-04-02T17:26:41Z","snapshot_observed_at":"2026-08-08T18:47:15.884862Z","submitted_at":"2019-04-02T17:26:41Z","title":"Analysing Mathematical Reasoning Abilities of Neural Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01557","snapshot_observed_at":"2026-08-05T12:25:28.462546Z","title":"Analysing mathematical reasoning abilities of neural models, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.462546Z"},"links":{"cited_paper":"/paper/1904.01557","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:d4d182e3795b9e3aefd8242a1f59787d49dab2a6eeb552593c9628baa55beac8","observation_id":"52a39e37-f54e-4ff0-8073-df32c9f50524","resolution":{"observed_at":"2026-08-05T12:25:28.462546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-07-06T18:49:16.284410Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-08-05T12:25:28.468096Z","title":"Bond: Aligning llms with best-of-n distillation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.468096Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:015cc250e14fee277a4c5f0ccaa9bd541a9a945a6aab54c638c00865ff248ec8","observation_id":"f223f575-148c-4056-abc9-c696b265925b","resolution":{"observed_at":"2026-08-05T12:25:28.468096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-05T12:25:28.473347Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.473347Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:f60c07ef992ab0ddf6fc5cef538018f4e9fadddc501822721c959ac22e521527","observation_id":"794df7d2-8c04-4523-afba-0c37c3b052a7","resolution":{"observed_at":"2026-08-05T12:25:28.473347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T12:25:28.477571Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.477571Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:4db95e7c32012a1d74f37898333121daf53597d84ac213ba114ae979b49c699b","observation_id":"cadc9b2e-20f5-4ea4-938f-aeb4cdea2e7d","resolution":{"observed_at":"2026-08-05T12:25:28.477571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11336","last_updated":"2025-04-24T03:13:28Z","snapshot_observed_at":"2026-08-07T16:02:06.740275Z","submitted_at":"2025-04-15T16:09:06Z","title":"Looking beyond the next token","version":2},"cited_work":{"arxiv_id":"2504.11336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11336","snapshot_observed_at":"2026-08-05T12:25:28.752493Z","title":"Looking beyond the next token","venue":"cs.LG","work_id":"effca14e-0003-43a7-bbd6-f37d5ea6dd77","year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.481689Z"},"links":{"cited_paper":"/paper/2504.11336","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:79742ef3f3114f3cfddd3b82b6ab16611d5839c8d37462084d75f6cd10b068db","observation_id":"b0e3b286-442b-4737-9c7e-39e4b5a9fd4c","resolution":{"observed_at":"2026-08-05T12:25:28.757794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T12:25:28.485825Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.485825Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:920e54315756d7d1a3e2e84e34d53cdbcefa02c01b7e88c5361259cb72c0ab94","observation_id":"8ff7a89c-ae5c-49ee-849d-0e5cdf7798b2","resolution":{"observed_at":"2026-08-05T12:25:28.485825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:25:28.490690Z","title":"Naturalreasoning: Reasoning in the wild with 2.8m challenging questions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.490690Z"},"links":{"citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:64f0123f4bf09069837c39764884ca01de3d23bfb8e4ca071588deab2a9d86a9","observation_id":"8db1bde8-d7fc-41c4-8ebd-99f2ca04cbfc","resolution":{"observed_at":"2026-08-05T12:25:28.490690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T12:25:28.494576Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.494576Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:5d9b4b169eec7daf1c74e3c476c7f2347e85fa3f16cae31582a3f85e5e159ddd","observation_id":"2f7f2f36-07a8-4106-bf54-b3fae88e91f3","resolution":{"observed_at":"2026-08-05T12:25:28.494576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12129","last_updated":"2023-05-20T07:30:55Z","snapshot_observed_at":"2026-07-31T03:05:30.804068Z","submitted_at":"2023-05-20T07:30:55Z","title":"Lifting the Curse of Capacity Gap in Distilling Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12129","snapshot_observed_at":"2026-08-05T12:25:28.499159Z","title":"Lifting the curse of capacity gap in distilling language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.499159Z"},"links":{"cited_paper":"/paper/2305.12129","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:7cf931fd26ddc671ebc3449ccf2113b3ef0d33d329ac41d599e6e0b67d4f58e1","observation_id":"45fc63d8-b021-47dd-ad0c-245369d337a8","resolution":{"observed_at":"2026-08-05T12:25:28.499159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07052","last_updated":"2025-07-30T16:00:53Z","snapshot_observed_at":"2026-07-06T16:46:22.210429Z","submitted_at":"2023-11-13T03:36:18Z","title":"Towards the Law of Capacity Gap in Distilling Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07052","snapshot_observed_at":"2026-08-05T12:25:28.503732Z","title":"Towards the law of capacity gap in distilling language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.503732Z"},"links":{"cited_paper":"/paper/2311.07052","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:531e4ddf99de8140a50e7e829ff6c85b9ad1fd0f362e1f89754d12f067812ba0","observation_id":"520022cd-cc73-4caa-9412-06279f1c3ca1","resolution":{"observed_at":"2026-08-05T12:25:28.503732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10859","last_updated":"2024-08-07T21:57:20Z","snapshot_observed_at":"2026-08-09T11:26:41.193970Z","submitted_at":"2024-04-16T19:17:23Z","title":"Forcing Diffuse Distributions out of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10859","snapshot_observed_at":"2026-08-05T12:25:28.508547Z","title":"Forcing diffuse distributions out of language models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T12:25:28.508547Z"},"links":{"cited_paper":"/paper/2404.10859","citing_paper":"/paper/2509.01649"},"observation_digest":"sha256:bca32dc3dd562d6d52bb80bc1184279a3da65d45636eaf6e450b0b8931da60f1","observation_id":"57f74805-85f5-41e1-a581-74370717f587","resolution":{"observed_at":"2026-08-05T12:25:28.508547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01649","last_updated":"2025-09-01T17:49:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:23:31.144023Z","submitted_at":"2025-09-01T17:49:14Z","title":"Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":4,"verified_fuzzy":16},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2509.01649."}