{"as_of":"2026-08-15T05:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9901645c2caa923b7366aea975e891ce0d2d76b987a26e16262da8bb0ab407df","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:52:37.270748Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:04:31.647548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:56:47.730179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-08-07T06:04:31.647548Z","title":"Knowledge injection via prompt distillation.arXiv preprint arXiv:2412.14964, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-14T17:13:29.084742Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:31.647548Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:89439216bda359ad95a5741dd81f2d364f005be2bc4191a0fab68e42043001bf","observation_id":"f90dd867-10d9-4bb4-b121-883f62cffc77","resolution":{"observed_at":"2026-08-07T06:04:31.647548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-12T12:02:18.586804Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T17:00:49.448352Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2605.03677"},"observation_digest":"sha256:8b6bd5264add688924c0cad473d854a63921940cb7020c8b46454acf0afeb338","observation_id":"e20039dd-2798-4308-8d3c-9870e2fd9dc7","resolution":{"observed_at":"2026-05-11T23:26:16.201002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2605.18226","last_updated":"2026-05-18T11:12:45Z","snapshot_observed_at":"2026-08-14T20:59:52.481729Z","submitted_at":"2026-05-18T11:12:45Z","title":"Context Memorization for Efficient Long Context Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T10:39:09.720412Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2605.18226"},"observation_digest":"sha256:f030b0a3845bc1852acb1d925a3deaae82f178bf58e4f6573907642ced5aa96b","observation_id":"fa696f57-f44a-4620-86a8-feb61f88b25c","resolution":{"observed_at":"2026-05-20T10:43:12.658948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2606.03979","last_updated":"2026-07-10T17:52:03Z","snapshot_observed_at":"2026-07-15T23:18:25.559225Z","submitted_at":"2026-06-02T17:56:55Z","title":"Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T10:56:13.058872Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.03979"},"observation_digest":"sha256:25b91188c48d9c6f8fe10cc3322e7d15cefc94c0fba4e7ccec3380359c7bb090","observation_id":"30f0f7d0-80a4-4a18-96fd-14e643e083d5","resolution":{"observed_at":"2026-07-02T02:26:26.803207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-13T07:44:25.325808Z","title":"Knowledge injection via prompt distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03979","last_updated":"2026-07-10T17:52:03Z","snapshot_observed_at":"2026-07-15T23:18:25.559225Z","submitted_at":"2026-06-02T17:56:55Z","title":"Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-13T07:44:25.325808Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.03979"},"observation_digest":"sha256:e63300b2a3b6bbd54900584ad11dd342ee78e844506632a0927c5aff9ee3c714","observation_id":"9db19840-b7a8-45e5-9367-6f811e4c40c4","resolution":{"observed_at":"2026-07-13T07:44:25.325808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2606.04703","last_updated":"2026-06-03T10:30:09Z","snapshot_observed_at":"2026-08-12T12:01:26.266953Z","submitted_at":"2026-06-03T10:30:09Z","title":"Rethinking Continual Experience Internalization for Self-Evolving LLM Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T06:29:11.398007Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.04703"},"observation_digest":"sha256:7610b0dbaf578e3fe9bcc3a5b6655a3ef025c6a6de91ff49bd873a24608c587b","observation_id":"2cbc327f-02d1-47a7-90a5-93bd6eb5c31b","resolution":{"observed_at":"2026-07-02T07:56:47.731556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2412.14964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14964","snapshot_observed_at":"2026-07-02T07:56:47.730179Z","title":"Efficient knowledge injection in llms via self-distillation","venue":null,"work_id":"95a7f2ed-6eee-44cd-9ea0-c8eccf9dcb6e","year":2024},"citing_paper":{"arxiv_id":"2606.32002","last_updated":"2026-06-30T17:35:14Z","snapshot_observed_at":"2026-08-15T03:04:10.151243Z","submitted_at":"2026-06-30T17:35:14Z","title":"Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T05:07:58.441326Z"},"links":{"cited_paper":"/paper/2412.14964","citing_paper":"/paper/2606.32002"},"observation_digest":"sha256:955dcbd2e712c61db0436f44fef583150762e3146b36ccc7be04a0859c01d3ba","observation_id":"0d92bd82-ed75-4d1e-914f-a3c13bc959a5","resolution":{"observed_at":"2026-07-01T10:45:42.802808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14964/citation-record","integrity":"/paper/2412.14964/integrity","json":"/paper/2412.14964/citation-record.json","paper":"/paper/2412.14964"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:52:37.086452Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.086452Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:d120ec0b04d1ea17ba1bd7a82734be5414b5d2f1e92f67d55085e6a8f92ade39","observation_id":"03e56360-c8f8-4595-8e27-5336625d58f7","resolution":{"observed_at":"2026-08-11T11:52:37.086452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14788","last_updated":"2023-11-04T04:09:43Z","snapshot_observed_at":"2026-08-13T11:34:50.734118Z","submitted_at":"2023-05-24T06:42:44Z","title":"Adapting Language Models to Compress Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14788","snapshot_observed_at":"2026-08-11T11:52:37.104311Z","title":"Adapting language models to compress contexts.arXiv preprint arXiv:2305.14788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.104311Z"},"links":{"cited_paper":"/paper/2305.14788","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:6f73296d8cf802bf5df6483ebc1ab1ea4f3d8ee3afb728c4cb62fa8e87c35154","observation_id":"47d91a7d-ffe6-4e50-8395-36040de64166","resolution":{"observed_at":"2026-08-11T11:52:37.104311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:52:37.112713Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.112713Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:204071c92ab1818854bcd69116bb7989e44e70b47af4ebebed7b7de2e3b6b2ed","observation_id":"56089bf7-56f8-46e6-a1b0-93035819f9a5","resolution":{"observed_at":"2026-08-11T11:52:37.112713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-12T18:39:37.539896Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-08-11T11:52:37.116782Z","title":"The false promise of imitating proprietary llms.arXiv preprint arXiv:2305.15717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.116782Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:5f74854409147a7fe518ce5fe136913b0e5d5d1e8fba3a89b3d9b1b87eed4518","observation_id":"7470d0fb-9905-4fb6-9e1e-93189fe3665b","resolution":{"observed_at":"2026-08-11T11:52:37.116782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10964","last_updated":"2020-05-05T22:00:44Z","snapshot_observed_at":"2026-08-14T11:20:15.686010Z","submitted_at":"2020-04-23T04:21:19Z","title":"Don't Stop Pretraining: Adapt Language Models to Domains and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10964","snapshot_observed_at":"2026-08-11T11:52:37.125237Z","title":"Don’t stop pretraining: Adapt language models to domains and tasks.arXiv preprint arXiv:2004.10964,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.125237Z"},"links":{"cited_paper":"/paper/2004.10964","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:0bd9d1eb46f444932a66f31ee0f40355f4f4be72bc37e640f401ff2014f77614","observation_id":"7796b37f-3803-4045-92a5-8329e84c5a90","resolution":{"observed_at":"2026-08-11T11:52:37.125237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T11:52:37.134081Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.134081Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:49023e86f29c0286bb3b1a39927c8ab35cb9fa8933bce538ce3ac33dac0cf271","observation_id":"9578ef48-9612-46c7-8956-972139b897bf","resolution":{"observed_at":"2026-08-11T11:52:37.134081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07922","last_updated":"2024-08-19T05:46:56Z","snapshot_observed_at":"2026-08-14T01:45:32.223808Z","submitted_at":"2023-08-15T17:59:18Z","title":"RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07922","snapshot_observed_at":"2026-08-11T11:52:37.143760Z","title":"Raven: In-context learning with retrieval augmented encoder-decoder language models.arXiv preprint arXiv:2308.07922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.143760Z"},"links":{"cited_paper":"/paper/2308.07922","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:4169e7a72481254001e5a999c902226cf56247feb9c07022d8de688dd5ba4afd","observation_id":"6126f122-a95f-4b8c-982d-f151609a3ea6","resolution":{"observed_at":"2026-08-11T11:52:37.143760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01282","last_updated":"2021-02-03T09:18:34Z","snapshot_observed_at":"2026-08-13T02:37:51.426086Z","submitted_at":"2020-07-02T17:44:57Z","title":"Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01282","snapshot_observed_at":"2026-08-11T11:52:37.148846Z","title":"Leveraging passage retrieval with generative models for open domain question answering.arXiv preprint arXiv:2007.01282,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.148846Z"},"links":{"cited_paper":"/paper/2007.01282","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:68e02f1f90bb669bf94c7b9be4bf949b08e9857e3cbcf3d3207a3c162a465760","observation_id":"2d269c3c-e99d-432c-9a0b-87bbf3a0aaa8","resolution":{"observed_at":"2026-08-11T11:52:37.148846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00172","last_updated":"2020-02-15T01:04:52Z","snapshot_observed_at":"2026-08-14T15:36:39.875900Z","submitted_at":"2019-11-01T01:09:53Z","title":"Generalization through Memorization: Nearest Neighbor Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00172","snapshot_observed_at":"2026-08-11T11:52:37.153376Z","title":"Generalization through memorization: Nearest neighbor language models.arXiv preprint arXiv:1911.00172,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.153376Z"},"links":{"cited_paper":"/paper/1911.00172","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:62642ef583b6955f69085edcee00ef7a4f2fbf7915ccb6b4d145b2849e424f34","observation_id":"805153a0-8015-4b22-91e7-c5dee28c07b2","resolution":{"observed_at":"2026-08-11T11:52:37.153376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01352","last_updated":"2024-05-06T07:50:35Z","snapshot_observed_at":"2026-08-13T05:59:08.287632Z","submitted_at":"2023-10-02T17:16:26Z","title":"RA-DIT: Retrieval-Augmented Dual Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01352","snapshot_observed_at":"2026-08-11T11:52:37.162226Z","title":"Ra-dit: Retrieval-augmented dual instruction tuning.arXiv preprint arXiv:2310.01352,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.162226Z"},"links":{"cited_paper":"/paper/2310.01352","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:c092e87fdd6caa4695714dda10b65df5cee39aca395c41e866c227be1be05c3b","observation_id":"763a6aab-fa9c-41fb-ac48-d46c6e206bb6","resolution":{"observed_at":"2026-08-11T11:52:37.162226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16724","last_updated":"2025-02-16T19:35:11Z","snapshot_observed_at":"2026-08-12T23:16:30.186995Z","submitted_at":"2024-07-23T12:38:48Z","title":"Structure-aware Domain Knowledge Injection for Large Language Models","version":3},"cited_work":{"arxiv_id":"2407.16724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.16724","snapshot_observed_at":"2026-08-11T11:52:37.515491Z","title":"Structure-aware Domain Knowledge Injection for Large Language Models","venue":"cs.CL","work_id":"677b5a5f-9238-4378-baac-89089549d7d5","year":2024},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.167306Z"},"links":{"cited_paper":"/paper/2407.16724","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:21aec00e7799bbf540150869ae4224aea544f54dd73e94163d62fdaffbd44328","observation_id":"e457e219-f634-44d5-a729-f0ae9a5cce2f","resolution":{"observed_at":"2026-08-11T11:52:37.522227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10225","last_updated":"2024-10-30T02:58:14Z","snapshot_observed_at":"2026-08-13T04:39:36.385944Z","submitted_at":"2024-01-18T18:59:11Z","title":"ChatQA: Surpassing GPT-4 on Conversational QA and RAG","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10225","snapshot_observed_at":"2026-08-11T11:52:37.171818Z","title":"Chatqa: Surpassing gpt-4 on conversational qa and rag.arXiv preprint arXiv:2401.10225, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.171818Z"},"links":{"cited_paper":"/paper/2401.10225","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:614a1fb9ce3c170e6b31a30304dc6a99f63bf0f50ddb59f58952659710299143","observation_id":"ef842316-cf51-4bb9-a7ce-5973f06ce800","resolution":{"observed_at":"2026-08-11T11:52:37.171818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-11T11:52:37.176676Z","title":"When not to trust language models: Investigating effectiveness and limitations of parametric and non-parametric memories.arXiv preprint arXiv:2212.10511, 7,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.176676Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:0e32ed9902b8081cf97d74282609e433545b79ebe9b9c4e4c4d94da18c335286","observation_id":"d9b8178e-5f41-4a8a-ab2b-ab4c75d8a82d","resolution":{"observed_at":"2026-08-11T11:52:37.176676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00213","last_updated":"2024-04-02T20:09:45Z","snapshot_observed_at":"2026-08-14T09:59:52.654720Z","submitted_at":"2024-03-30T01:56:07Z","title":"Injecting New Knowledge into Large Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00213","snapshot_observed_at":"2026-08-11T11:52:37.181478Z","title":"Injecting new knowledge into large language models via supervised fine-tuning.arXiv preprint arXiv:2404.00213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.181478Z"},"links":{"cited_paper":"/paper/2404.00213","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:5c1093ac1a64896a7db2a434ba0478871fc14874a8eef6c7ba635297cd693d21","observation_id":"03a92b77-3952-4e84-b964-e741a3d76cf3","resolution":{"observed_at":"2026-08-11T11:52:37.181478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-08-13T05:22:43.282546Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-11T11:52:37.186069Z","title":"Orca 2: Teaching small language models how to reason.arXiv preprint arXiv:2311.11045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.186069Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:317fa1c62c2c9a3bddb33ef215e381d130d39d78672124386de21b3ad1c1bed2","observation_id":"e55a76c8-fa4c-4235-b91f-3c9b16d18ec2","resolution":{"observed_at":"2026-08-11T11:52:37.186069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05686","last_updated":"2020-05-05T00:20:48Z","snapshot_observed_at":"2026-08-12T06:13:23.601768Z","submitted_at":"2020-04-12T19:49:27Z","title":"XtremeDistil: Multi-stage Distillation for Massive Multilingual Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05686","snapshot_observed_at":"2026-08-11T11:52:37.191047Z","title":"Xtremedistil: Multi-stage distillation for massive multilingual models.arXiv preprint arXiv:2004.05686,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.191047Z"},"links":{"cited_paper":"/paper/2004.05686","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:ddaa374e2e663a95fa8735e03fc05d5836d00f0817509f879c225ebfb6075fad","observation_id":"26f47e3f-fd91-49cd-95c9-4cc7954909a3","resolution":{"observed_at":"2026-08-11T11:52:37.191047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-11T11:52:37.195772Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4.arXiv preprint arXiv:2306.02707,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.195772Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:9fad249088b01d0fd4e724e5ac5370f8b426fbcb5b11212f90c6d58eb68a1756","observation_id":"7fe94a89-d997-4c74-b92f-321de45756cd","resolution":{"observed_at":"2026-08-11T11:52:37.195772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18334","last_updated":"2024-09-11T16:28:29Z","snapshot_observed_at":"2026-08-14T13:42:27.877120Z","submitted_at":"2024-02-28T13:54:57Z","title":"Learning to Generate Instruction Tuning Datasets for Zero-Shot Task Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18334","snapshot_observed_at":"2026-08-11T11:52:37.200189Z","title":"Learning to generate instruction tuning datasets for zero-shot task adaptation.arXiv preprint arXiv:2402.18334,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.200189Z"},"links":{"cited_paper":"/paper/2402.18334","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:7f1f2842507d1c0c26cc971494c16ef26ce0e428132a3f84bf0f96c79198b065","observation_id":"a180c0bd-0333-46ef-aed6-f19a61b16814","resolution":{"observed_at":"2026-08-11T11:52:37.200189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05934","last_updated":"2024-01-30T11:58:10Z","snapshot_observed_at":"2026-08-14T02:11:00.839407Z","submitted_at":"2023-12-10T16:52:00Z","title":"Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05934","snapshot_observed_at":"2026-08-11T11:52:37.204758Z","title":"Fine-tuning or retrieval? comparing knowledge injection in llms.arXiv preprint arXiv:2312.05934,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.204758Z"},"links":{"cited_paper":"/paper/2312.05934","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:c169c6003f04acd1f78f48660fd68f4eda05cbd46164345bf825c8c7629afc79","observation_id":"46ae1da7-bb1f-4efc-9158-6a63d3e710b9","resolution":{"observed_at":"2026-08-11T11:52:37.204758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-11T11:52:37.209209Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.209209Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:23a27dbba15167cc3380bc9393db09d5f40f4c97b11354dc78628c812d0dc8e7","observation_id":"a7e5019a-b4ba-410f-b011-5f50298570a3","resolution":{"observed_at":"2026-08-11T11:52:37.209209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11194","last_updated":"2025-03-30T20:10:35Z","snapshot_observed_at":"2026-08-13T10:00:45.999905Z","submitted_at":"2024-06-17T04:00:04Z","title":"In-Context Editing: Learning Knowledge from Self-Induced Distributions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11194","snapshot_observed_at":"2026-08-11T11:52:37.213565Z","title":"In-context editing: Learning knowledge from self-induced distributions.arXiv preprint arXiv:2406.11194,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.213565Z"},"links":{"cited_paper":"/paper/2406.11194","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:c9c162cceab61ec26553d935b5a3631dff72630b386211d2c30cb2987f55e467","observation_id":"1154c72e-e39c-4a94-93eb-bcfe8809d26c","resolution":{"observed_at":"2026-08-11T11:52:37.213565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-08-14T04:21:28.978034Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-11T11:52:37.222089Z","title":"Multitask prompted training enables zero-shot task generalization.arXiv preprint arXiv:2110.08207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.222089Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:1793386228367c33c19756b774a71d64a1ac26a326fadbfc08dd523fd71d7812","observation_id":"9f8816d2-bda9-4d46-8d19-94c6926739ec","resolution":{"observed_at":"2026-08-11T11:52:37.222089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12652","last_updated":"2023-05-24T05:08:07Z","snapshot_observed_at":"2026-08-02T02:08:12.414817Z","submitted_at":"2023-01-30T04:18:09Z","title":"REPLUG: Retrieval-Augmented Black-Box Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12652","snapshot_observed_at":"2026-08-11T11:52:37.226208Z","title":"Large language models can be easily distracted by irrelevant context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.226208Z"},"links":{"cited_paper":"/paper/2301.12652","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:abcef7282cf14c0527482aa2c07c4b4c44fe0ed4a1847ab7de59feac0236e7fe","observation_id":"a716a0cc-f600-487b-afc5-c2031fd2c167","resolution":{"observed_at":"2026-08-11T11:52:37.226208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07713","last_updated":"2024-05-29T04:15:39Z","snapshot_observed_at":"2026-08-14T06:31:02.937147Z","submitted_at":"2023-10-11T17:59:05Z","title":"InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07713","snapshot_observed_at":"2026-08-11T11:52:37.230237Z","title":"Instructretro: Instruction tuning post retrieval-augmented pretraining.arXiv preprint arXiv:2310.07713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.230237Z"},"links":{"cited_paper":"/paper/2310.07713","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:cc266c916e834639167c23d82d3b401778ffb20faed81e6a1d6e505ce50cf07b","observation_id":"ed94ebae-474a-4acb-a0d6-1e8c7e463793","resolution":{"observed_at":"2026-08-11T11:52:37.230237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13618","last_updated":"2024-11-05T13:17:56Z","snapshot_observed_at":"2026-08-12T23:39:08.560638Z","submitted_at":"2024-06-19T15:14:55Z","title":"In-Context Former: Lightning-fast Compressing Context for Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13618","snapshot_observed_at":"2026-08-11T11:52:37.234248Z","title":"In-context former: Lightning-fast compressing context for large language model.arXiv preprint arXiv:2406.13618, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.234248Z"},"links":{"cited_paper":"/paper/2406.13618","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:1a1e4d1238a7a951185cc3f921e3cdcedddf002837506ddb391cbdd0f89f6893","observation_id":"6a66c2b8-fb06-43a0-8531-eda96ea69d6c","resolution":{"observed_at":"2026-08-11T11:52:37.234248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-11T10:35:06.989614Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-11T11:52:37.238593Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.238593Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:c46da4a1f65d2808ae79204fed0ed321a0f90d150cd3d4e302042e8c1c7ad423","observation_id":"923c68cc-4294-4dd4-a31e-c97c1eb74b92","resolution":{"observed_at":"2026-08-11T11:52:37.238593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10131","last_updated":"2024-06-05T17:27:51Z","snapshot_observed_at":"2026-08-13T00:53:38.526176Z","submitted_at":"2024-03-15T09:26:02Z","title":"RAFT: Adapting Language Model to Domain Specific RAG","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10131","snapshot_observed_at":"2026-08-11T11:52:37.246602Z","title":"Raft: Adapting language model to domain specific rag.arXiv preprint arXiv:2403.10131,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.246602Z"},"links":{"cited_paper":"/paper/2403.10131","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:ceeae8425129ea2549317e518960697aef082005634ac14481d70432656b82cf","observation_id":"dbb9e362-91b0-48c8-ab4d-527e837e71b0","resolution":{"observed_at":"2026-08-11T11:52:37.246602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.821711Z","title":null,"venue":null,"work_id":"4f4aaaf4-d976-4e13-9294-95b07944d25d","year":2020},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.250250Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:3e2e27c95b92782df287acbb72e6e354faf8178de9ad140dfece0ba6cd00db65","observation_id":"41bedcf0-75ff-4798-ae30-f499cb4282e0","resolution":{"observed_at":"2026-08-11T11:52:37.826001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.807541Z","title":"C Related Work: More Detailed Review of Context Distillation In prior work, context distillation has been used for in-context learning and qualitatively modifying LLM behavior","venue":null,"work_id":"7d7a763f-80d5-40f8-9a58-c6539dd3e6e6","year":2021},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.254877Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:5dc8f8cd45ac56e6de9fbec3e1f205e88d553717182e9d9313ce8a4b736cbee4","observation_id":"04e9f70e-b46c-466b-8655-729caef3457b","resolution":{"observed_at":"2026-08-11T11:52:37.811775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.792532Z","title":"We found Bonito capable of generating competitive questions for the New York Times dataset","venue":null,"work_id":"0fade3aa-2772-4dbe-b9f9-de805ed9cd98","year":2019},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.258972Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:1caecd62f35ea3cce3f3250df0b8710cda2bba68bc6b5861e817a9a2a8b8a497","observation_id":"9cbae46e-8cd4-4a99-91cb-f11120cdc24f","resolution":{"observed_at":"2026-08-11T11:52:37.796868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.777549Z","title":"To explore potential factors underlying this phenomenon, we examine two key statistical properties of the teacher model’s outputs:","venue":null,"work_id":"1b06a0c9-8291-4901-a069-61aec19783b2","year":2023},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.262850Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:41af023f8a99be20f7680ff367e0cac2670732487372c0552c5a6d3ba8873d68","observation_id":"9b9bc418-12e8-4212-bca3-54286de8d69b","resolution":{"observed_at":"2026-08-11T11:52:37.783268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.761404Z","title":"This characteristic may help explain why Llama-3- 8B-Instruct demonstrates superior performance as an expert compared to Qwen2.5-72B-Instruct (Table 3)","venue":null,"work_id":"698d9a2f-ea95-4e32-bcb1-8705c454266a","year":2022},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.266686Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:33de9248d6519b32699d25ced7819568192ed00b55d8023e0e9dc5b47a0a0c86","observation_id":"84748132-158c-4def-b593-fbe1bb9e97ad","resolution":{"observed_at":"2026-08-11T11:52:37.766198Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.748863Z","title":"Splendid Cities","venue":null,"work_id":"e3a305d8-9142-4dcf-b2b4-95706e2cf5c3","year":1996},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.270748Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:124553f52b762cbea707426a1dcc0355a1120ad36b1b147af324521fc81dbc8c","observation_id":"241a108e-0ec2-4009-a715-e53238617d53","resolution":{"observed_at":"2026-08-11T11:52:37.752900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-11T11:52:37.217777Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.217777Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:7ad0e44e0747936d7a29670481d027aa2f9819126f812258b520b78b6285bd32","observation_id":"123ed824-d287-4346-b5ab-1066c915c06f","resolution":{"observed_at":"2026-08-11T11:52:37.217777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T11:52:37.138767Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.138767Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:dc6687d4fc4df0d72a393a19b6de308f503a11542319ebc4768667e67fdfc3ed","observation_id":"f5475e12-fc41-4d5d-a90e-3e6d776adc2f","resolution":{"observed_at":"2026-08-11T11:52:37.138767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T11:52:37.157917Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.157917Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:379939e0208048a2505a91bb30198118e3d678e894ce7f5195ca3221af8bc620","observation_id":"8b57b03b-a881-4fed-b327-2bbbb52cb362","resolution":{"observed_at":"2026-08-11T11:52:37.157917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09089","last_updated":"2024-04-17T15:18:54Z","snapshot_observed_at":"2026-08-13T10:09:27.054086Z","submitted_at":"2023-10-13T13:17:03Z","title":"Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09089","snapshot_observed_at":"2026-08-11T11:52:37.242707Z","title":"Qilin-med: Multi-stage knowledge injection advanced medical large language model.arXiv preprint arXiv:2310.09089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.242707Z"},"links":{"cited_paper":"/paper/2310.09089","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:844e5e00c18b4f7d45dade196e62ec404404573c1bf8ae2af79421c604264122","observation_id":"54ab17d3-19ec-4103-9bdb-3bbfe2983a89","resolution":{"observed_at":"2026-08-11T11:52:37.242707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11349","last_updated":"2022-07-15T07:15:31Z","snapshot_observed_at":"2026-08-13T15:33:29.367150Z","submitted_at":"2022-05-31T08:43:07Z","title":"Prompt Injection: Parameterization of Fixed Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11349","snapshot_observed_at":"2026-08-11T11:52:37.108513Z","title":"Prompt injection: Parameterization of fixed inputs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.108513Z"},"links":{"cited_paper":"/paper/2206.11349","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:43a08dcbd29273513742b2729553073c0ec37b56149a8afd4094b97816f8becc","observation_id":"072dd78b-6d67-4811-a065-c09d41319785","resolution":{"observed_at":"2026-08-11T11:52:37.108513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13788","last_updated":"2020-10-18T22:49:31Z","snapshot_observed_at":"2026-07-06T08:25:47.087616Z","submitted_at":"2019-09-30T15:30:00Z","title":"Revisiting Self-Training for Neural Sequence Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.13788","snapshot_observed_at":"2026-08-11T11:52:37.129494Z","title":"Revisiting self-training for neural sequence generation.arXiv preprint arXiv:1909.13788,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.129494Z"},"links":{"cited_paper":"/paper/1909.13788","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:dd44f7e3571af90933a1fed672c6878fc8ef6b100d4f131adb6cb6ee66ff9597","observation_id":"992cede1-a7a6-4848-b9c0-527f3f93f629","resolution":{"observed_at":"2026-08-11T11:52:37.129494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07646","last_updated":"2023-03-06T06:28:18Z","snapshot_observed_at":"2026-08-03T19:51:05.627063Z","submitted_at":"2022-02-15T18:48:31Z","title":"Quantifying Memorization Across Neural Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07646","snapshot_observed_at":"2026-08-11T11:52:37.099890Z","title":"Quantifying memorization across neural language models.arXiv preprint arXiv:2202.07646,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.099890Z"},"links":{"cited_paper":"/paper/2202.07646","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:eee07f991468b80b028cf7432eec78aaed531c0e07b5ea4b955f160ac8e5c669","observation_id":"3973a647-d213-43d5-a2d9-69ab10f3e25e","resolution":{"observed_at":"2026-08-11T11:52:37.099890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:37.095907Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.095907Z"},"links":{"citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:e58392143cc3ba03c8ac2a35f10e6f46a215b01f2bfcd55c2ab1952f4a5ed94b","observation_id":"5740aedf-cc3a-4b95-bee8-5e89c618310e","resolution":{"observed_at":"2026-08-11T11:52:37.095907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08406","last_updated":"2024-01-30T13:55:34Z","snapshot_observed_at":"2026-08-14T23:08:11.792885Z","submitted_at":"2024-01-16T14:44:47Z","title":"RAG vs Fine-tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08406","snapshot_observed_at":"2026-08-11T11:52:37.121350Z","title":"Rag vs fine-tuning: Pipelines, tradeoffs, and a case study on agriculture.arXiv preprint arXiv:2401.08406,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.121350Z"},"links":{"cited_paper":"/paper/2401.08406","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:1e974bd622943ab626751beff612833252322311efbc271c3de263e5a9549b9a","observation_id":"2a09967e-9457-49e0-a6fd-06aa0687e991","resolution":{"observed_at":"2026-08-11T11:52:37.121350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-11T11:52:37.091278Z","title":"Accessed: 2024- 12-02","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:37.091278Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2412.14964"},"observation_digest":"sha256:52c543559f09f3cad8f71d9ade04d8a2acbeb2f0e686986da5c5928de7aa827e","observation_id":"28f18322-0f4e-4095-974c-ca52efd91650","resolution":{"observed_at":"2026-08-11T11:52:37.091278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14964","last_updated":"2025-08-07T09:12:17Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T18:22:07.618078Z","submitted_at":"2024-12-19T15:44:01Z","title":"Efficient Knowledge Injection in LLMs via Self-Distillation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 7 inbound Pith citation observations for arXiv:2412.14964."}