{"as_of":"2026-08-14T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b25b6a9704cf293b1c53b6c3e18d623dc2997999751a056ee923c698e349fcc","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:45:20.262730Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16991/citation-record","integrity":"/paper/2411.16991/integrity","json":"/paper/2411.16991/citation-record.json","paper":"/paper/2411.16991"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T12:45:19.855397Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.855397Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:55c8b398536aa930ce94470554f02b63f8b555713b108951cd90680142cccd70","observation_id":"cd5c9030-ce5b-43b1-a197-7b3d490c28c8","resolution":{"observed_at":"2026-08-12T12:45:19.855397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T12:45:19.889753Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.889753Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:b3dd51affed6b3706d1df708d65a7f71fea8a3ce360c308554e86d28248496ec","observation_id":"8c262949-5c80-4ffe-ab5d-dfb7786e1826","resolution":{"observed_at":"2026-08-12T12:45:19.889753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09755","last_updated":"2021-01-24T17:03:57Z","snapshot_observed_at":"2026-08-11T22:24:32.130290Z","submitted_at":"2021-01-24T17:03:57Z","title":"RomeBERT: Robust Training of Multi-Exit BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09755","snapshot_observed_at":"2026-08-12T12:45:19.900099Z","title":"Romebert: Robust training of multi-exit bert","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.900099Z"},"links":{"cited_paper":"/paper/2101.09755","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:4520a001fba19e5f5b57fc2732fee97c8844f764321b8f4744184e9004d7e9c4","observation_id":"a0f75dc3-05f2-4fd2-9af7-18dbc227be31","resolution":{"observed_at":"2026-08-12T12:45:19.900099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-13T23:36:51.421273Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01851","snapshot_observed_at":"2026-08-12T12:45:19.910575Z","title":"Self-knowledge distillation in natural language processing.arXiv preprint arXiv:1908.01851,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.910575Z"},"links":{"cited_paper":"/paper/1908.01851","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ce884ec5ee679a807644bcce79f790e75447869fc3f23e941e8dbb52f0ad4b4e","observation_id":"15a08c71-bb43-4622-9580-fd57349bdcea","resolution":{"observed_at":"2026-08-12T12:45:19.910575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T12:45:19.927555Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.927555Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:6c38bc02b3e054749aeef3743442b3d1c24b26faee9762125e0db872ce403d90","observation_id":"aae5d057-ae16-496e-8c74-ad02021637c9","resolution":{"observed_at":"2026-08-12T12:45:19.927555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-12T12:45:19.938293Z","title":"Distilling step-by-step! outperform- ing larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.938293Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:3900116743336738e15b17c6ebf76eee7fea9e8abbd91aa8cbbcd83b0e071f49","observation_id":"5ca3f85d-265e-4574-a822-8c505ac89bde","resolution":{"observed_at":"2026-08-12T12:45:19.938293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T12:45:19.943841Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.943841Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:61f061ad18971b9d250c15bc11d974eb41fd75c08395d52b02d751c1fe626541","observation_id":"e1d129ea-d400-4496-8c4c-eab8b38787fe","resolution":{"observed_at":"2026-08-12T12:45:19.943841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-10T14:27:02.964369Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-12T12:45:19.949757Z","title":"Tinybert: Distilling bert for natural language understanding","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.949757Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:a6ee099b53106de95869ab6ff12a8f598c7bb6079f2f7813d5b2dd4bdd0ccf69","observation_id":"dbba784e-85c6-400e-8868-c4ba96e9c083","resolution":{"observed_at":"2026-08-12T12:45:19.949757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-13T05:19:35.675322Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-12T12:45:19.955519Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.955519Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:c573e868bd2f34e1317c90cd01bd01d5cca43f14bd9c75f2e9aa925e899ad9f6","observation_id":"ca37dec1-f373-4fd3-a31f-644000543747","resolution":{"observed_at":"2026-08-12T12:45:19.955519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-12T12:45:19.960719Z","title":"Albert: A lite bert for self-supervised learning of language representations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.960719Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:b38fb5cfa6785880d79e83a9219df17f6cb07ba6a925633af661969e24cf81ac","observation_id":"32436a6a-6055-4265-b736-69fcbe4a4017","resolution":{"observed_at":"2026-08-12T12:45:19.960719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18239","last_updated":"2023-05-26T13:24:49Z","snapshot_observed_at":"2026-08-13T11:32:27.850789Z","submitted_at":"2023-05-26T13:24:49Z","title":"A Study on Knowledge Distillation from Weak Teacher for Scaling Up Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":"2305.18239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18239","snapshot_observed_at":"2026-08-12T12:45:21.030731Z","title":"A Study on Knowledge Distillation from Weak Teacher for Scaling Up Pre-trained Language Models","venue":"cs.CL","work_id":"bd09cde2-62b0-41d3-8e00-1bab3bc41c48","year":2023},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.965765Z"},"links":{"cited_paper":"/paper/2305.18239","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ce488f198aaf056a3011fc6338b9fb8a06850e170e3eb36a5813fb0594d779d9","observation_id":"09e53d6a-af0e-4efb-9e38-eaa2008ab2fe","resolution":{"observed_at":"2026-08-12T12:45:21.036127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11295","last_updated":"2021-09-23T11:02:24Z","snapshot_observed_at":"2026-08-13T18:06:04.433621Z","submitted_at":"2021-09-23T11:02:24Z","title":"Dynamic Knowledge Distillation for Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11295","snapshot_observed_at":"2026-08-12T12:45:19.970608Z","title":"Dynamic knowledge distillation for pre-trained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.970608Z"},"links":{"cited_paper":"/paper/2109.11295","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:2bc2c1c4c8756d05fab56c8f298bc96b087a3305dce5841654831c1b5296d8a8","observation_id":"137651d1-b7d0-40f5-a61e-c143f1b4387d","resolution":{"observed_at":"2026-08-12T12:45:19.970608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14050","last_updated":"2024-04-15T21:58:27Z","snapshot_observed_at":"2026-08-13T11:10:03.254684Z","submitted_at":"2023-06-24T20:15:07Z","title":"Symbolic Chain-of-Thought Distillation: Small Models Can Also \"Think\" Step-by-Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14050","snapshot_observed_at":"2026-08-12T12:45:19.975270Z","title":"Sym- bolic chain-of-thought distillation: Small models can also” think” step-by-step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.975270Z"},"links":{"cited_paper":"/paper/2306.14050","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:370d01bc33a8509f0cacedda9be2c5a7191581410dfa15d58e85632a797d6a25","observation_id":"bae96d79-ed68-40cc-b5d4-e0f678fbd458","resolution":{"observed_at":"2026-08-12T12:45:19.975270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09632","last_updated":"2023-02-19T17:37:24Z","snapshot_observed_at":"2026-08-13T12:41:56.267262Z","submitted_at":"2023-02-19T17:37:24Z","title":"HomoDistil: Homotopic Task-Agnostic Distillation of Pre-trained Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09632","snapshot_observed_at":"2026-08-12T12:45:19.980207Z","title":"Homodistil: Ho- motopic task-agnostic distillation of pre-trained transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.980207Z"},"links":{"cited_paper":"/paper/2302.09632","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:1e0a8b6b86ac1b927d5d972effe918f4f10d2b0d8dae08e379c6b7bc2466a919","observation_id":"e5826e16-c35b-4d9e-b6f8-2fa2f3f3be66","resolution":{"observed_at":"2026-08-12T12:45:19.980207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.00593","last_updated":"2021-03-17T06:38:05Z","snapshot_observed_at":"2026-07-06T10:10:39.816933Z","submitted_at":"2020-11-01T18:47:51Z","title":"MixKD: Towards Efficient Distillation of Large-scale Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.00593","snapshot_observed_at":"2026-08-12T12:45:19.986364Z","title":"Mixkd: Towards efficient distillation of large-scale language models","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.986364Z"},"links":{"cited_paper":"/paper/2011.00593","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:6d4741384ff1a5eaa6751ac53260e60aa04016bce773111821b820bd9eba13fd","observation_id":"f263b0b1-ad39-454c-b65d-f4e05f8a9aed","resolution":{"observed_at":"2026-08-12T12:45:19.986364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.739584Z","title":"A global past-future early exit method for accelerating inference of pre-trained language models","venue":null,"work_id":"0820560d-04ed-40b5-bfe3-c78ebc529934","year":2021},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.991839Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:eb2481a53a6648f406b45d91dfad599e9cfbe8e4f058bef0f4c66522709e03e9","observation_id":"0664d6d8-4972-4801-8218-d7b2ae0f2091","resolution":{"observed_at":"2026-08-12T12:45:21.745370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-13T10:15:11.378091Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-12T12:45:19.996512Z","title":"Program induction by rationale gener- ation: Learning to solve and explain algebraic word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.996512Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:94723ad2daa9d65b0f8420ae00ff268ee12f74846c5807872087e47d6f695fe8","observation_id":"ed4711c8-ca6e-4016-b684-9f154eb58e4a","resolution":{"observed_at":"2026-08-12T12:45:19.996512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02178","last_updated":"2020-04-29T15:46:34Z","snapshot_observed_at":"2026-08-13T23:05:37.436121Z","submitted_at":"2020-04-05T12:29:20Z","title":"FastBERT: a Self-distilling BERT with Adaptive Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02178","snapshot_observed_at":"2026-08-12T12:45:20.001464Z","title":"Fastbert: a self-distilling bert with adaptive inference time","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.001464Z"},"links":{"cited_paper":"/paper/2004.02178","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:9479474e92d20184e44d70bfa85959db7c96bc2c8a4fa71b4d960e219a010126","observation_id":"497eb5fe-b15e-4d14-8804-456ea0c82a86","resolution":{"observed_at":"2026-08-12T12:45:20.001464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09214","last_updated":"2024-04-07T19:17:53Z","snapshot_observed_at":"2026-08-13T13:18:49.137591Z","submitted_at":"2023-11-15T18:56:23Z","title":"Mind's Mirror: Distilling Self-Evaluation Capability and Comprehensive Thinking from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09214","snapshot_observed_at":"2026-08-12T12:45:20.007152Z","title":"Mind’s mirror: Distilling self-evaluation capability and comprehensive thinking from large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.007152Z"},"links":{"cited_paper":"/paper/2311.09214","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:bc56e7e228da8630eb6a2f6957f5c6e11611a6256491d91ff5bd77e8ee819cab","observation_id":"7e8350f0-7a47-4d07-8541-a3d9be12c581","resolution":{"observed_at":"2026-08-12T12:45:20.007152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11504","last_updated":"2019-05-30T00:01:20Z","snapshot_observed_at":"2026-07-06T07:30:20.997518Z","submitted_at":"2019-01-31T18:07:25Z","title":"Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11504","snapshot_observed_at":"2026-08-12T12:45:20.012458Z","title":"Multi-task deep neural networks for natural language understanding","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.012458Z"},"links":{"cited_paper":"/paper/1901.11504","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:03bfd730f62e8b6c2252174ffe2f79f5711612ba2c8a03cc35bca87532341ec8","observation_id":"5bbc6500-41bd-440b-87ee-34559a81b19b","resolution":{"observed_at":"2026-08-12T12:45:20.012458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.723816Z","title":"Big/little deep neural network for ultra low power inference","venue":null,"work_id":"cd673114-13ce-4934-8dd4-3299d2126144","year":2015},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.018202Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:6eb7e7ed1c542a991b2278c94cef087b3dbf958be897c66e6b6804b0abd24612","observation_id":"9c22838a-2c52-4b74-91ac-eca9b5ce87f7","resolution":{"observed_at":"2026-08-12T12:45:21.728730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08359","last_updated":"2021-09-17T05:51:45Z","snapshot_observed_at":"2026-08-13T08:02:38.981757Z","submitted_at":"2021-09-17T05:51:45Z","title":"Distilling Linguistic Context for Language Model Compression","version":1},"cited_work":{"arxiv_id":"2109.08359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.08359","snapshot_observed_at":"2026-08-12T12:45:20.838492Z","title":"Distilling Linguistic Context for Language Model Compression","venue":"cs.CL","work_id":"6574def1-7815-4b19-a4f1-932ba1c83dd7","year":2021},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.023028Z"},"links":{"cited_paper":"/paper/2109.08359","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:1419b284bfbb484e088b3c9a513d958aef3afecb4edeb251e1c66e71ee316069","observation_id":"ff5c6fb0-3b13-4d05-bc17-b544f3503d6f","resolution":{"observed_at":"2026-08-12T12:45:20.844940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-12T12:45:20.028487Z","title":"Are nlp models really able to solve simple math word problems? arXiv preprint arXiv:2103.07191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.028487Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ef7e810619cfb3e1098bfb13beb7c4a9f134e245ded44f2d86dd2e8eea553bae","observation_id":"b017b3d7-60ae-48f4-bdcf-2939633300f4","resolution":{"observed_at":"2026-08-12T12:45:20.028487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09121","last_updated":"2019-04-27T09:31:59Z","snapshot_observed_at":"2026-07-06T06:57:46.546190Z","submitted_at":"2018-08-28T05:16:35Z","title":"WiC: the Word-in-Context Dataset for Evaluating Context-Sensitive Meaning Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.09121","snapshot_observed_at":"2026-08-12T12:45:20.034338Z","title":"Wic: the word-in-context dataset for eval- uating context-sensitive meaning representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.034338Z"},"links":{"cited_paper":"/paper/1808.09121","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:1354e0ae7df23f5432a4ee3e89a88601a78ee6af8d1d3fe4d1f671b1c7a8fbae","observation_id":"de8c9074-bee0-44a6-89f7-5569af0dcd49","resolution":{"observed_at":"2026-08-12T12:45:20.034338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-12T23:01:26.406202Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-12T12:45:20.039995Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.039995Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:55374feb199e15df29514a3dc1ca2e2f9265c74445a55e7d883fc46393a40ec0","observation_id":"df5a3842-1519-497f-89c1-5d5e7005c112","resolution":{"observed_at":"2026-08-12T12:45:20.039995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09651","last_updated":"2024-05-15T15:32:27Z","snapshot_observed_at":"2026-08-13T23:15:18.047527Z","submitted_at":"2023-05-16T17:50:09Z","title":"Tailoring Instructions to Student's Learning Levels Boosts Knowledge Distillation","version":3},"cited_work":{"arxiv_id":"2305.09651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09651","snapshot_observed_at":"2026-08-12T12:45:20.745122Z","title":"Tailoring Instructions to Student's Learning Levels Boosts Knowledge Distillation","venue":"cs.CL","work_id":"85f2eae2-1734-43e1-b03e-37f026c4c7fb","year":2023},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.045548Z"},"links":{"cited_paper":"/paper/2305.09651","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:c0b131fbf13c6b99c29225aa47bd6934ca5d6bc68c450ce124791429b1e81c51","observation_id":"3b392747-60cc-4fb1-9045-90ebcced3b0e","resolution":{"observed_at":"2026-08-12T12:45:20.753246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:20.052005Z","title":"Choice of plausible alternatives: An evaluation of commonsense causal reasoning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.052005Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:8334acbfcfe8460853b41b7c1559a12fc870353278a698f642efe88ead56be10","observation_id":"c33a2cd8-3593-4078-b552-825e0089133d","resolution":{"observed_at":"2026-08-12T12:45:20.052005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08803","last_updated":"2021-09-09T17:57:04Z","snapshot_observed_at":"2026-08-14T00:39:18.926352Z","submitted_at":"2021-04-18T10:22:28Z","title":"Consistent Accelerated Inference via Confident Adaptive Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08803","snapshot_observed_at":"2026-08-12T12:45:20.061438Z","title":"Consistent accelerated inference via confident adaptive transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.061438Z"},"links":{"cited_paper":"/paper/2104.08803","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:a840b4d92d0190c4ffb36b4e2b17dcf554d6f4dd0f064eb52805058e52cb348a","observation_id":"ba3b25f5-f500-44ff-92aa-71bb5818687a","resolution":{"observed_at":"2026-08-12T12:45:20.061438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07453","last_updated":"2020-05-09T03:45:10Z","snapshot_observed_at":"2026-08-14T13:37:25.292065Z","submitted_at":"2020-04-16T04:28:08Z","title":"The Right Tool for the Job: Matching Model and Instance Complexities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07453","snapshot_observed_at":"2026-08-12T12:45:20.065896Z","title":"The right tool for the job: Matching model and instance complexities","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.065896Z"},"links":{"cited_paper":"/paper/2004.07453","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:403f1e8e8fdcafddcc51040dca39a1a2a60b6a3bb9ac308784a6cdf92af6d93e","observation_id":"9497d9c9-35e2-4518-8ebb-c7f59b4c34d0","resolution":{"observed_at":"2026-08-12T12:45:20.065896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18039","last_updated":"2024-02-28T04:33:20Z","snapshot_observed_at":"2026-08-13T04:08:35.642085Z","submitted_at":"2024-02-28T04:33:20Z","title":"ResLoRA: Identity Residual Mapping in Low-Rank Adaption","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18039","snapshot_observed_at":"2026-08-12T12:45:20.070951Z","title":"Reslora: Identity residual mapping in low-rank adaption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.070951Z"},"links":{"cited_paper":"/paper/2402.18039","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:d306c6ce1b56a9d06dee25a8c6bf337e9631c33c11ee1f1098372d297ba29304","observation_id":"62b38499-9f24-4bde-9d23-a12af74593a6","resolution":{"observed_at":"2026-08-12T12:45:20.070951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00193","last_updated":"2023-05-18T04:44:51Z","snapshot_observed_at":"2026-08-13T13:30:26.462794Z","submitted_at":"2022-12-01T00:39:56Z","title":"Distilling Reasoning Capabilities into Smaller Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00193","snapshot_observed_at":"2026-08-12T12:45:20.076077Z","title":"Distilling reasoning capabilities into smaller language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.076077Z"},"links":{"cited_paper":"/paper/2212.00193","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:7e9314f77e43ed674a4edbf30ea4b211dd32ca27a42f8a4e9890b0c968b5c92c","observation_id":"cf79f997-8984-4103-93fc-7b75e0bf4c72","resolution":{"observed_at":"2026-08-12T12:45:20.076077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-13T05:04:53.813940Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-12T12:45:20.080762Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.080762Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:1880659a0485394c6684510e63e5af864a367b9f99544da09f42f96f67fb731d","observation_id":"671dc132-9b2f-4109-9e30-31bbe50d3824","resolution":{"observed_at":"2026-08-12T12:45:20.080762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:20.085846Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.085846Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:d105a4ba6ff494a66ff2f40be075e20323053339a26906a4cddb5466be5c4893","observation_id":"83e6d587-5300-434b-9c34-677f6539318e","resolution":{"observed_at":"2026-08-12T12:45:20.085846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-14T11:11:56.612741Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-12T12:45:20.090860Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.090860Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:80c2d11308d654aab50c0f9b685569f60663ee3d67e48b1f828ef297a9cec169","observation_id":"af6f62af-1040-45e5-baf7-f7e4e16d33ae","resolution":{"observed_at":"2026-08-12T12:45:20.090860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13792","last_updated":"2021-05-28T12:54:11Z","snapshot_observed_at":"2026-08-13T19:14:31.652675Z","submitted_at":"2021-05-28T12:54:11Z","title":"Early Exiting with Ensemble Internal Classifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13792","snapshot_observed_at":"2026-08-12T12:45:20.095740Z","title":"Early exiting with ensemble internal classifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.095740Z"},"links":{"cited_paper":"/paper/2105.13792","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:2012493bd865ad99b6ccce47801989ac9c7b9c6d15edb8295a8a1794ca5117e9","observation_id":"93a6a742-da9d-4b58-a6da-bed3ff595c0c","resolution":{"observed_at":"2026-08-12T12:45:20.095740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02984","last_updated":"2020-04-14T23:54:36Z","snapshot_observed_at":"2026-08-06T09:03:09.275283Z","submitted_at":"2020-04-06T20:20:58Z","title":"MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02984","snapshot_observed_at":"2026-08-12T12:45:20.100589Z","title":"Mobile- bert: a compact task-agnostic bert for resource-limited devices.arXiv preprint arXiv:2004.02984,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.100589Z"},"links":{"cited_paper":"/paper/2004.02984","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:1a04ad30b877dfc92a59edaf8b3712c585944f9b37b976bfda503ac78c8e7d8b","observation_id":"7ab00b3e-ea88-43c3-9cfb-b2f93fd69927","resolution":{"observed_at":"2026-08-12T12:45:20.100589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12136","last_updated":"2019-03-28T17:23:50Z","snapshot_observed_at":"2026-07-06T07:42:21.954799Z","submitted_at":"2019-03-28T17:23:50Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12136","snapshot_observed_at":"2026-08-12T12:45:20.105391Z","title":"Distilling task- specific knowledge from bert into simple neural networks","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.105391Z"},"links":{"cited_paper":"/paper/1903.12136","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:70da2e5865b1e88b94ef1b98dc6a5c73bb5d85e08b4565ffd0842cb1670db8c1","observation_id":"3304cc41-c9c9-425f-a353-6ce338a71649","resolution":{"observed_at":"2026-08-12T12:45:20.105391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:20.110647Z","title":"Branchynet: Fast inference via early exiting from deep neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.110647Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:6f0a228a71db0c6f071d2329f1372bf61f3b9c245afd76bd0644e39215453270","observation_id":"ef10f0cc-f0bd-4634-9e45-833c2b964278","resolution":{"observed_at":"2026-08-12T12:45:20.110647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T12:45:20.115991Z","title":"Llama 2: Open founda- tion and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.115991Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:6a139cdcdbfbe22435d0f366035986c6fcb209f53cd6cffe3290bdc9c56d308a","observation_id":"bbf218b9-251a-4cee-b52a-19741c11c797","resolution":{"observed_at":"2026-08-12T12:45:20.115991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08962","last_updated":"2019-09-25T22:55:20Z","snapshot_observed_at":"2026-08-14T11:22:56.909379Z","submitted_at":"2019-08-23T18:02:05Z","title":"Well-Read Students Learn Better: On the Importance of Pre-training Compact Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08962","snapshot_observed_at":"2026-08-12T12:45:20.120970Z","title":"Well-read students learn better: On the importance of pre-training compact models","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.120970Z"},"links":{"cited_paper":"/paper/1908.08962","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ae8f97378d0dae75488fef9bf2072d4f404e4ddfdc7793589a30d5960095cee3","observation_id":"37cc3924-0318-48e3-ab6a-de92fcc986a5","resolution":{"observed_at":"2026-08-12T12:45:20.120970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-12T12:45:20.125827Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.125827Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:46640b551f23280e9d1d9aadd38ddf777b3434c6e5a78e2355093948e362be5e","observation_id":"d533196e-2c69-47ea-933c-03c5e95b23fd","resolution":{"observed_at":"2026-08-12T12:45:20.125827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00444","last_updated":"2023-02-01T13:40:19Z","snapshot_observed_at":"2026-08-13T12:53:30.856398Z","submitted_at":"2023-02-01T13:40:19Z","title":"Improved Knowledge Distillation for Pre-trained Language Models via Knowledge Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00444","snapshot_observed_at":"2026-08-12T12:45:20.130774Z","title":"Improved knowl- edge distillation for pre-trained language models via knowledge selection","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.130774Z"},"links":{"cited_paper":"/paper/2302.00444","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:48cb5786b8720c20b4b17181a371394f9c7b2213c9d53ead7dc6b33e8cedafae","observation_id":"b95498d3-cdbf-4545-b8c0-ba3788c4c058","resolution":{"observed_at":"2026-08-12T12:45:20.130774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05426","last_updated":"2018-02-19T19:19:51Z","snapshot_observed_at":"2026-08-11T00:55:53.228136Z","submitted_at":"2017-04-18T17:10:13Z","title":"A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05426","snapshot_observed_at":"2026-08-12T12:45:20.135954Z","title":"A broad-coverage challenge corpus for sentence understanding through inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.135954Z"},"links":{"cited_paper":"/paper/1704.05426","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:3f355d53022baf943808f56b8a638cadf4e7ad2c3743082fd0aa17c52e0eb39d","observation_id":"8ae8f840-ff82-47e5-9918-91296ec94440","resolution":{"observed_at":"2026-08-12T12:45:20.135954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.02505","last_updated":"2022-06-03T23:44:44Z","snapshot_observed_at":"2026-08-13T17:21:54.494523Z","submitted_at":"2021-12-05T08:13:09Z","title":"Causal Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02505","snapshot_observed_at":"2026-08-12T12:45:20.145677Z","title":"Causal distillation for language models","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.145677Z"},"links":{"cited_paper":"/paper/2112.02505","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:4adb40bcbde73986995e1634d8452a43d6aaaf5f578b795f16ce0d8184f45d6a","observation_id":"d18eb5ee-1628-485e-97f8-3d16e6c4981b","resolution":{"observed_at":"2026-08-12T12:45:20.145677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03923","last_updated":"2022-10-17T06:56:48Z","snapshot_observed_at":"2026-08-14T06:56:23.563531Z","submitted_at":"2022-10-08T05:25:34Z","title":"Sparse Teachers Can Be Dense with Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03923","snapshot_observed_at":"2026-08-12T12:45:20.150812Z","title":"Sparse teachers can be dense with knowledge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.150812Z"},"links":{"cited_paper":"/paper/2210.03923","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:5b5565a4300b54c25ffc040f12e7ea444d20278d592d900794b320e0c9e231e8","observation_id":"03018741-bede-4ba4-82b0-6921d519b596","resolution":{"observed_at":"2026-08-12T12:45:20.150812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-12T12:45:20.155805Z","title":"Hellaswag: Can a ma- chine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.155805Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:a1b0e9c03de2829907620117c289eaa4a0b7f3af148d4135a8f640a601ae4952","observation_id":"1c1973a7-5fc7-4275-8667-be40f58c6934","resolution":{"observed_at":"2026-08-12T12:45:20.155805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.677238Z","title":"Mini- mal distillation schedule for extreme language model compression","venue":null,"work_id":"cdfa70cb-5edc-46e1-8bf6-bc44cd7dacef","year":2024},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.160870Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:0cfeb9626176011320d1969015b894a37978d681a40959fef674a1e418fa268c","observation_id":"38c8cdfb-2aef-490d-8854-d78295a9b47f","resolution":{"observed_at":"2026-08-12T12:45:21.682340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17140","last_updated":"2024-06-06T03:59:24Z","snapshot_observed_at":"2026-08-14T10:14:35.503113Z","submitted_at":"2024-04-26T03:41:28Z","title":"Small Language Models Need Strong Verifiers to Self-Correct Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17140","snapshot_observed_at":"2026-08-12T12:45:20.165403Z","title":"Small language models need strong verifiers to self-correct rea- soning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.165403Z"},"links":{"cited_paper":"/paper/2404.17140","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:b2d4e1e8bacd6c3d9dbfdeafd4f31e1863b96a6831ec1ba3fe6c927b6146490c","observation_id":"5443ab3d-21fd-4b53-98f2-b7b7a4a15b2a","resolution":{"observed_at":"2026-08-12T12:45:20.165403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T12:45:20.170533Z","title":"A survey of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.170533Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:2a36e67570798397fd3a5335e8e05b4fe526e9f9b9ff91b3c7a01fe8a44b01eb","observation_id":"e95a2405-d66b-47ba-83af-749879a5d814","resolution":{"observed_at":"2026-08-12T12:45:20.170533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04570","last_updated":"2022-04-01T22:29:40Z","snapshot_observed_at":"2026-08-13T21:44:11.875055Z","submitted_at":"2021-06-08T17:59:03Z","title":"BERT Learns to Teach: Knowledge Distillation with Meta Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04570","snapshot_observed_at":"2026-08-12T12:45:20.175736Z","title":"Bert learns to teach: Knowledge distillation with meta learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.175736Z"},"links":{"cited_paper":"/paper/2106.04570","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:fd5e5f04dd75821a53ee72f9aa8b2c732b07ca6e00deb696f3568cc395e2f1c3","observation_id":"e0daff95-ede8-4958-ae03-03b63f0ef06e","resolution":{"observed_at":"2026-08-12T12:45:20.175736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13888","last_updated":"2024-03-20T08:37:42Z","snapshot_observed_at":"2026-08-13T11:35:44.685163Z","submitted_at":"2023-05-23T10:11:56Z","title":"PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13888","snapshot_observed_at":"2026-08-12T12:45:20.180921Z","title":"Pad: Program-aided distillation can teach small models reasoning better than chain-of-thought fine- tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.180921Z"},"links":{"cited_paper":"/paper/2305.13888","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:e3e48c7ed087f801e267865130f2090b5a362d17762ccb9509ec3cf7c8f87fef","observation_id":"6597f0b2-09ce-435a-8e16-6b832946d65a","resolution":{"observed_at":"2026-08-12T12:45:20.180921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.661992Z","title":"Recently, researchers have attached great significance to the KD study in PLMs (Sun et al., 2022)","venue":null,"work_id":"ece32733-6d61-48e9-b3b1-430ec0bbceb6","year":2016},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.186087Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:1f87afd2f19944f65356ea2f3da8d0ee5e0c807949ab23540c8400116716ed9b","observation_id":"9cb60f6c-2414-499c-be8b-fce08240fe30","resolution":{"observed_at":"2026-08-12T12:45:21.666937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.647401Z","title":null,"venue":null,"work_id":"d43e9bd8-beda-48d1-8f47-d19f75bb42d3","year":2020},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.190818Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:8470c47b06f9255a972fed0677c15c717108eeba255c37414745ced7162ab57d","observation_id":"6d36fa64-e71f-4c50-8a27-d7d38b4a00aa","resolution":{"observed_at":"2026-08-12T12:45:21.652060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.632430Z","title":"Recently, inspired by MetaDistil (Zhou et al., 2021), Ren et al.(Ren et al.,","venue":null,"work_id":"ff0cd2ee-b858-45c2-8d0d-14a2edf8344e","year":2021},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.195972Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:0445e3b4d46441439810cb54cefb04b25b7247e08c07e0bd862523c350462a8a","observation_id":"b85c0e20-680d-47d1-b587-3cf7a841d29d","resolution":{"observed_at":"2026-08-12T12:45:21.637067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.615855Z","title":"For instance, DistilBERT (Sanh et al., 2019), MINILM (Wang et al., 2020b), and MobileBERT (Sun et al.,","venue":null,"work_id":"6c494d8f-506b-439c-b5f9-a2983c1dfa58","year":2019},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.200598Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:5f6b7aa2c163703cdf959df6b558306be973e9c557d6346fa58baf0a4428ac28","observation_id":"8b50b7c1-5779-43ae-8b14-7b1cd17ebb66","resolution":{"observed_at":"2026-08-12T12:45:21.621305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.600130Z","title":"Based on MiniLLM, works on studying KD for auto-regressive LLMs (Agarwal et al., 2024; Ko et al.,","venue":null,"work_id":"d8d0b579-1514-4400-aac1-e5985a88756d","year":2024},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.205290Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:06d36a672094d1eba423c75758e2bcd736f025c3404c2c588342a8daddd24139","observation_id":"21641f7e-1506-47f9-93f0-d3a635b199d4","resolution":{"observed_at":"2026-08-12T12:45:21.605112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.584363Z","title":null,"venue":null,"work_id":"804befbc-43d1-4055-9cf4-a52d3b1d0e85","year":2018},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.209904Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:be688e6f270187d69034ace08c61f6ac7ac114e514035f99b1a879e9166c80e5","observation_id":"3b573a0e-be15-4dd0-bb8c-7f8858b78e7e","resolution":{"observed_at":"2026-08-12T12:45:21.589209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.569183Z","title":"With the emergence of PLMs (Sun et al., 2022), people have begun to study the application of SelfD on them","venue":null,"work_id":"3673b7c2-93e1-4cf9-bdbb-78d1375649ba","year":2022},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.214947Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:bfeefdf447e18fff39f8c3bff44529b2ac3379b440d58161f9bbe2bad0aca067","observation_id":"9ab00848-613e-4c2d-8256-5239697c4eef","resolution":{"observed_at":"2026-08-12T12:45:21.574150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.553541Z","title":"Though not reducing model sizes, it decreases computation by using inserted internal classifiers into a Transformer-based model (e.g., 12-layer BERT-base)","venue":null,"work_id":"fe06bc27-2927-458f-a260-9f26b4f59c55","year":2019},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.219614Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:9e1abf20402fa78965a109c30eed949f356e0c61521114c32663499386dc0e6c","observation_id":"5d50122c-5600-4942-a0cf-eb39fedb3bfe","resolution":{"observed_at":"2026-08-12T12:45:21.558362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.536894Z","title":"EE techniques for PLMs focus on exit criteria, which currently have three types (Xu & McAuley, 2023): confidence estimation, internal ensemble, and learning to exit","venue":null,"work_id":"404c2b9e-8b71-45da-9a99-eb1faf4af926","year":2023},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.224375Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:fd445f6e6bb685a6a9f18181131ab719e14eef2566aadc9b0fd6e6c926ad2ade","observation_id":"7d47cb61-60fd-4e7a-994c-ab4c20bc8ad2","resolution":{"observed_at":"2026-08-12T12:45:21.542281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.518920Z","title":"During inference, the model exits early when an IC predicts a probability with an entropy below the threshold","venue":null,"work_id":"1887da02-9f09-4972-8ee8-bd3caca87c4b","year":2020},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.229054Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:393fce92a337a6c15fa35b2f7fffdf453298d81d4bfa7b8a7817471f9f4075a6","observation_id":"7c13ef59-3c99-43fb-94b4-03bb515b71ab","resolution":{"observed_at":"2026-08-12T12:45:21.525746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.499632Z","title":null,"venue":null,"work_id":"420d9623-b009-49ad-9348-bd00c50b21ed","year":2020},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.233544Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:3b3245548f7498e91135b335eb0b7bf33472ae5cd2b64d9ac5f440f5a3b4863e","observation_id":"f2f74490-4a1e-4196-a3f0-22b74700243c","resolution":{"observed_at":"2026-08-12T12:45:21.505162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.481524Z","title":"Liao et al","venue":null,"work_id":"2b692d5f-3d0b-402a-9145-0ab2473f910e","year":2020},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.238204Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:acf39ec2a700115ffbb1e2bac481bc570127084c5c87dd75c4c0db95c7eb5daf","observation_id":"f4ad7e23-6c2f-4141-a278-bcadebe28b09","resolution":{"observed_at":"2026-08-12T12:45:21.486973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.461524Z","title":"It serves as a benchmark for evaluating the performance of models across various language understanding tasks","venue":null,"work_id":"8f55e8ec-e59c-487c-b578-f65e14733030","year":2017},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.242977Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ff28612fb4ef0f0bff5048d37987f51d2808ff218687ada12ee059bf10a001fa","observation_id":"ede566cf-a38f-4e50-8f05-ec132f8c86b0","resolution":{"observed_at":"2026-08-12T12:45:21.466806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.445830Z","title":"It was introduced as a more challenging successor to the original GLUE benchmark (Wang et al., 2018), reflecting the rapid advancements in NLP technologies and model capabilities","venue":null,"work_id":"c352cfd3-a99b-48b1-86ac-457fefbae68c","year":2018},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.247909Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ac01b43dc9c2853a20cce28e79f4b7c04b7440d0a19a8ca815da98b5ff0512df","observation_id":"0b4d1b0e-e4d4-46eb-9f52-eed6ce9b2ee7","resolution":{"observed_at":"2026-08-12T12:45:21.451110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.429983Z","title":"For commonsense tasks, we select HellaSwag (HS) (Zellers et al., 2019)","venue":null,"work_id":"0448c60e-be2c-45b3-925f-2fbfdf32a0d2","year":2019},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.252812Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ef0154f7b9364cde248c10dab5cc032ae9c2495b9d5b81fc6c0c2aa39003bbac","observation_id":"d2f3c1f6-c541-4004-9e86-74765380d621","resolution":{"observed_at":"2026-08-12T12:45:21.435163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.413600Z","title":"This dataset is designed to test both comprehension and arithmetic skills in a more controlled synthetic setting","venue":null,"work_id":"451044e8-22ac-43bf-a6f1-c0964c315ab7","year":2017},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.257624Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:50796d23f6188982f44d5e0be80d8cf6230ad26a341a91ca95fc3a692a165cbf","observation_id":"e84196c9-eda2-401c-9269-f86c2006c694","resolution":{"observed_at":"2026-08-12T12:45:21.418668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.395821Z","title":"It presents contexts from a wide array of domains and requires models to predict the most likely or plausible continuation among given choices","venue":null,"work_id":"f9de1bf1-8315-4312-99a8-6d65a9e76a57","year":2019},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.262730Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:ee2493a1b5c968986e75aaee3727def4bda9c1938ed54785f97dd7612a74069b","observation_id":"524d002e-6e82-423f-8ad2-46ef66017154","resolution":{"observed_at":"2026-08-12T12:45:21.401539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14747","last_updated":"2023-12-20T06:50:20Z","snapshot_observed_at":"2026-08-13T10:17:32.400864Z","submitted_at":"2023-10-23T09:32:53Z","title":"MCC-KD: Multi-CoT Consistent Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14747","snapshot_observed_at":"2026-08-12T12:45:19.866920Z","title":"Mcc-kd: Multi-cot consistent knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.866920Z"},"links":{"cited_paper":"/paper/2310.14747","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:5ecb05f690f12570b39b9e793fb88fc71fd5fabef14ac01a23dd129c5869fbb9","observation_id":"23666cba-034c-4974-b035-d8916a2e660e","resolution":{"observed_at":"2026-08-12T12:45:19.866920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-12T12:45:20.056612Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.056612Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:33b8b8120acdcdf58f59c111f97dea0f1da4fd3a8eb2bd1bd5d3289eb33c46d6","observation_id":"adc8b3f8-4e80-46d2-894b-d60ba539272b","resolution":{"observed_at":"2026-08-12T12:45:20.056612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-13T13:18:22.882788Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-12T12:45:19.932907Z","title":"Large language models are reasoning teachers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.932907Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:01dfa987257489427e2d15d2263f602444b781a2b469a3bdd63f78bfe3177bdb","observation_id":"1353c1cf-bae0-4b15-b3c8-b866e30d01ce","resolution":{"observed_at":"2026-08-12T12:45:19.932907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T12:45:19.916845Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.916845Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:f20d67a3478f4bb0bd20d8fbe5b9f96d9e844c1d35e32bc7f8f0f80e055262ff","observation_id":"09fe76da-f4e4-4059-8432-c263093fe682","resolution":{"observed_at":"2026-08-12T12:45:19.916845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01023","last_updated":"2021-06-02T08:42:33Z","snapshot_observed_at":"2026-08-13T19:12:00.633466Z","submitted_at":"2021-06-02T08:42:33Z","title":"One Teacher is Enough? Pre-trained Language Model Distillation from Multiple Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01023","snapshot_observed_at":"2026-08-12T12:45:20.140755Z","title":"One teacher is enough? pre-trained language model distillation from multiple teachers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:20.140755Z"},"links":{"cited_paper":"/paper/2106.01023","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:8144364952a05301113897209545a4980e5bc489c90c365520cdb60c50fb3326","observation_id":"22f5248d-ac3c-449a-8b1f-7997f5b05802","resolution":{"observed_at":"2026-08-12T12:45:20.140755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-12T12:45:19.872344Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.872344Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:4fcc0074d622ff5aba98a1796c997d76c57229f70591e5bf44e5e246b04642ee","observation_id":"05589fc6-7fef-492d-ac64-59311a9f490c","resolution":{"observed_at":"2026-08-12T12:45:19.872344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T12:45:19.878101Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.878101Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:8453bfec1ca5a888d6442eb08ed4e63bfc1580003b42bf26d4d8e50cf6f55f1a","observation_id":"e4f803f6-a2d3-47c7-a113-2e37f89f7a62","resolution":{"observed_at":"2026-08-12T12:45:19.878101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09543","last_updated":"2023-03-24T09:17:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-18T06:48:00Z","title":"DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09543","snapshot_observed_at":"2026-08-12T12:45:19.922552Z","title":"Debertav3: Improving deberta using electra-style pre-training with gradient-disentangled embedding sharing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.922552Z"},"links":{"cited_paper":"/paper/2111.09543","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:de2fdbb7f64cc72f6a32d5fbd7f1070987e45a1e29b8ff61f7139d72d0052a15","observation_id":"13a62572-9a71-48ec-83e5-754146d4fd36","resolution":{"observed_at":"2026-08-12T12:45:19.922552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:45:21.756868Z","title":"Cost-effective distillation of large language models","venue":null,"work_id":"554c492c-b437-4af4-ba85-58cfdc033dc6","year":2023},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.884636Z"},"links":{"citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:3ff6b4990a1e163e21aa435232e5daff920a7909801acc992c1b856f8e4056aa","observation_id":"5352a212-24e8-4e85-9c1f-465713e87e30","resolution":{"observed_at":"2026-08-12T12:45:21.761911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T12:45:19.894833Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.894833Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:10517a3f90b879c2b5fb9909f9281ccc400171bda4eab61cb8db2bd6cdb5b037","observation_id":"cf9ea5c9-77d5-49c9-bc3e-6bad42e70709","resolution":{"observed_at":"2026-08-12T12:45:19.894833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-12T12:45:19.905572Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.905572Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:029358f63039f5d411c72455cbec1bfc91ae97420eb0bd16470d849a8b592557","observation_id":"45ca44a1-94d7-4a30-a9dd-e1a56e2ee52b","resolution":{"observed_at":"2026-08-12T12:45:19.905572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-10T18:39:13.771066Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-12T12:45:19.861361Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based for- malisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.861361Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:3ef094e578af578dc415a1f9f3c75356f1f0cbddcc549736dfff77aad103369d","observation_id":"bc63d689-db93-4c23-96e8-aedbe1e2b784","resolution":{"observed_at":"2026-08-12T12:45:19.861361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":3,"verified_fuzzy":18},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2411.16991."}