{"as_of":"2026-08-13T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfb7aa3ef3d0f05b6952a5178c7820d380fd2f27886f0e7079a449d92b588dee","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:25.825552Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T11:55:50.897500Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T11:55:51.079688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"cited_work":{"arxiv_id":"2506.15702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15702","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minifinetuning: Low-data gen- eration domain adaptation through corrective self-distillation","venue":null,"work_id":"5037cff1-83c4-4d98-a1ab-1a23805b55de","year":2025},"citing_paper":{"arxiv_id":"2506.02153","last_updated":"2025-09-15T22:15:00Z","snapshot_observed_at":"2026-08-12T13:48:47.535846Z","submitted_at":"2025-06-02T18:35:16Z","title":"Small Language Models are the Future of Agentic AI","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T11:55:50.897500Z"},"links":{"cited_paper":"/paper/2506.15702","citing_paper":"/paper/2506.02153"},"observation_digest":"sha256:345a17531befe535664185da9834aea58f0de93277625344d8537eb2f7e94854","observation_id":"7bfa0aa3-81b3-4c95-96b7-4eddc78029c9","resolution":{"observed_at":"2026-05-16T11:55:51.081789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15702/citation-record","integrity":"/paper/2506.15702/integrity","json":"/paper/2506.15702/citation-record.json","paper":"/paper/2506.15702"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.328062Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning","venue":null,"work_id":"414b87ef-4e3d-4e80-af09-78c7fec99aa8","year":1950},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:21.901340Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:80cc67b0040118b14f7b31d6f7678898af2113133b03fa663d16ed843da03c79","observation_id":"b9924e1f-e1e8-4d68-ae66-05b90dd5e44a","resolution":{"observed_at":"2026-08-07T12:40:28.392773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10054","last_updated":"2022-02-21T09:03:34Z","snapshot_observed_at":"2026-08-11T01:24:45.524652Z","submitted_at":"2022-02-21T09:03:34Z","title":"Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10054","snapshot_observed_at":"2026-08-07T12:40:21.984686Z","title":"Fine-tuning can distort pretrained features and underperform out-of-distribution.arXiv preprint arXiv:2202.10054 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:21.984686Z"},"links":{"cited_paper":"/paper/2202.10054","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:2bede8783c46c368236f5c70066f03aee38047a0010dfea8c7bdf86f528b4768","observation_id":"2166bd8d-13a3-4ede-b97d-d8758d1b375e","resolution":{"observed_at":"2026-08-07T12:40:21.984686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.129171Z","title":"Distill and replay for continual language learning","venue":null,"work_id":"45e69087-e8ea-4fca-970c-85b87b342226","year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.104922Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:999f9c78469158e52ef243551c25d40703eb4a5277eda335e7ad719dd5062a02","observation_id":"36d6d8aa-9349-4e21-82e5-716189de53a6","resolution":{"observed_at":"2026-08-07T12:40:28.237234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07470","last_updated":"2024-04-11T04:22:15Z","snapshot_observed_at":"2026-08-13T00:32:57.927307Z","submitted_at":"2024-04-11T04:22:15Z","title":"Scalable Language Model with Generalized Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07470","snapshot_observed_at":"2026-08-07T12:40:22.174315Z","title":"Scalable language model with generalized continual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.174315Z"},"links":{"cited_paper":"/paper/2404.07470","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:26a946da5aaa2b6aa6fe28b833259aabaee306ecd478fa45c5d81ebad35a0580","observation_id":"0136af4c-2c5a-43b4-bca9-15aa968675cf","resolution":{"observed_at":"2026-08-07T12:40:22.174315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16789","last_updated":"2024-11-25T05:27:13Z","snapshot_observed_at":"2026-08-13T00:22:04.546556Z","submitted_at":"2024-04-25T17:38:57Z","title":"Continual Learning of Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16789","snapshot_observed_at":"2026-08-07T12:40:22.228275Z","title":"Continual learning of large language models: A comprehensive survey.arXiv preprint arXiv:2404.16789 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.228275Z"},"links":{"cited_paper":"/paper/2404.16789","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:41d9d4a9a5709cb126031b0e9286f4c0fc3e65dee6af996da82a300805336aa5","observation_id":"d27f66ef-674d-47ad-9826-b7b39c8ef32e","resolution":{"observed_at":"2026-08-07T12:40:22.228275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:40:22.273316Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.273316Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:01312e5df7323ce33ab3792c7fe67f7fa8d1cf8cd98852f28562c12d75a6fefa","observation_id":"ada8e617-2b84-4a42-81c6-6ece30a7ae44","resolution":{"observed_at":"2026-08-07T12:40:22.273316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.325270Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.325270Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:26c2835842d58e5c15a1052d19b9e6a4a57d74a4f33031e20ac64a825a28301b","observation_id":"532801a0-376d-414e-9637-7faeb31f872b","resolution":{"observed_at":"2026-08-07T12:40:22.325270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T12:40:22.403153Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685 , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.403153Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:c87e9feb42055b6aef8f5da0c96d4a7d0f1b891413f0178c3759cf02238725df","observation_id":"03c095da-ffbb-4ca9-9bf5-dac60207c9b0","resolution":{"observed_at":"2026-08-07T12:40:22.403153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-07T12:40:22.478505Z","title":"Dora: Weight-decomposed low-rank adaptation.arXiv preprint arXiv:2402.09353 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.478505Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:298628ef6c278ca6b606915ac0019f1341d6c476805c339cf5d9ba3d28aebe73","observation_id":"7e690718-46dd-42f6-b1a3-406a06b9cc7a","resolution":{"observed_at":"2026-08-07T12:40:22.478505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.900492Z","title":"Mitigating the alignment tax of rlhf, 2024","venue":null,"work_id":"ca7d122e-1625-4de2-85b6-79b207fabb12","year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.563915Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:818b754681888855ff182da56ccf0ec68a1ef9bc5c7e3c4536253f24da76fca1","observation_id":"4dce038a-5dd7-40d0-a31c-5a324fb5d4c7","resolution":{"observed_at":"2026-08-07T12:40:28.001975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-12T23:25:27.368960Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-07T12:40:22.685924Z","title":"Reuse, don’t retrain: A recipe for continued pretraining of language models.arXiv preprint arXiv:2407.07263 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.685924Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:94f75a5b206f9c34f6e9805d9dcf3cfb9014aac8f0e2172256b3803105cfd8ec","observation_id":"131f8fd6-9ce0-4c47-9148-a405da58db28","resolution":{"observed_at":"2026-08-07T12:40:22.685924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00409","last_updated":"2019-06-30T16:32:28Z","snapshot_observed_at":"2026-07-31T08:47:31.689663Z","submitted_at":"2019-06-30T16:32:28Z","title":"Evaluating Language Model Finetuning Techniques for Low-resource Languages","version":1},"cited_work":{"arxiv_id":"1907.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00409","snapshot_observed_at":"2026-08-07T12:40:26.952893Z","title":"Evaluating Language Model Finetuning Techniques for Low-resource Languages","venue":"cs.CL","work_id":"dccb32e9-f3f7-4cf3-9b9c-c9af7a00878f","year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.799461Z"},"links":{"cited_paper":"/paper/1907.00409","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:5868450ad044adc7c265a55927f93d2a40e8740382a7e26c909b08f90ad3707a","observation_id":"e32bdeb5-a6b0-4a28-9b14-b1b1c7ddcb8a","resolution":{"observed_at":"2026-08-07T12:40:27.015634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02981","last_updated":"2024-01-24T18:16:34Z","snapshot_observed_at":"2026-08-13T04:50:35.316687Z","submitted_at":"2024-01-01T06:22:04Z","title":"Fine-tuning and Utilization Methods of Domain-specific LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02981","snapshot_observed_at":"2026-08-07T12:40:22.930321Z","title":"Fine-tuning and utilization methods of domain-specific llms.arXiv preprint arXiv:2401.02981 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:22.930321Z"},"links":{"cited_paper":"/paper/2401.02981","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:71b933c372069d19d4bffc01f43661e2c87a483c84f891af6e17684b35c1b78b","observation_id":"56542d17-5577-4ebc-bd31-b1ba87260097","resolution":{"observed_at":"2026-08-07T12:40:22.930321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.677546Z","title":"Harnessing pre-trained neural networks with rules for formality style transfer","venue":null,"work_id":"b00a1b63-a7a4-4887-b9c4-ff70ec5a0314","year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.069557Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:c5374f2e8f74c153fda593d986b324d8936a6389451a3b97e6a0c6d0c3bf9f77","observation_id":"534cfb67-86f9-4389-8742-ee595b0b2694","resolution":{"observed_at":"2026-08-07T12:40:27.784303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:23.184609Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.184609Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:51ec7745ad4fa34974c9465f51784aefe602502ec6a21c94a9fd35644a2bb87e","observation_id":"b23a30d4-143b-4992-bb28-64b1b23c7ccf","resolution":{"observed_at":"2026-08-07T12:40:23.184609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-08-13T00:24:15.939292Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T12:40:23.283185Z","title":"Openelm: An efficient language model family with open-source training and inference framework.arXiv preprint arXiv:2404.14619 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.283185Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:a5fa48510bff6f73b738786259d724ac589d55de83566182e58e14d21f7e316b","observation_id":"8d64e5a8-a154-4bab-af04-d1c6479caf9d","resolution":{"observed_at":"2026-08-07T12:40:23.283185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.479856Z","title":"GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow, March 2021","venue":null,"work_id":"e163bfd9-45ab-47a3-8ede-bff4437fa6e1","year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.356559Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:bbba2204eb8ff7d4dbab83f57c2f42b1b8e56df5a0c7bedd1fc49327c1afe99d","observation_id":"9bb6b675-a755-4d53-8141-790b5eed44ef","resolution":{"observed_at":"2026-08-07T12:40:27.545350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-10T21:55:43.802039Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-07T12:40:23.446594Z","title":"Textbooks are all you need.arXiv preprint arXiv:2306.11644, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.446594Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:950da19ee7002b0f5fe305bb4125a7e511f80171b7fdf8cce21b57eaf47a838e","observation_id":"11a82b97-dbbc-4169-b6ec-fca206eccbb0","resolution":{"observed_at":"2026-08-07T12:40:23.446594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:40:23.571712Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.571712Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:32ce729dae67267a2009c1defde9ee55993de15de28c54ff41b62fba70d42faa","observation_id":"21135899-76bd-4f7a-8647-ee4c8f05deb1","resolution":{"observed_at":"2026-08-07T12:40:23.571712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T12:40:23.706659Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.706659Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:ca8466a934c383944bbfbef60940ba694151dfaef34780499c42fe861893e8a5","observation_id":"fe04fba2-d9cc-488d-b5e8-d4df9cfc286d","resolution":{"observed_at":"2026-08-07T12:40:23.706659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14679","last_updated":"2024-11-04T17:36:38Z","snapshot_observed_at":"2026-08-12T23:18:20.834754Z","submitted_at":"2024-07-19T21:47:57Z","title":"Compact Language Models via Pruning and Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14679","snapshot_observed_at":"2026-08-07T12:40:23.840008Z","title":"Compact language models via pruning and knowledge distillation.arXiv preprint arXiv:2407.14679 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.840008Z"},"links":{"cited_paper":"/paper/2407.14679","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:ca3eca61775203b880232fe25b85484adc55e47186d2b5e0b0f1904762293458","observation_id":"7e664326-fcfb-4341-93bd-a253106a72d5","resolution":{"observed_at":"2026-08-07T12:40:23.840008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:40:23.979348Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:23.979348Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:726e4ef5f1841d47f7436b62bed1f446f3c9c943f6f8ae120eb3ea99e7696b49","observation_id":"6cdce6dd-8b70-4fad-a826-1650997c087c","resolution":{"observed_at":"2026-08-07T12:40:23.979348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.467617Z","title":"Pmc open access subset, 2024","venue":null,"work_id":"2b6cdf2b-590d-45dd-ae91-a999740d8304","year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.123062Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:2b8cc2a2b6bf94c9f20a297044b173541bc5180197fda51ac21a3d46210832bf","observation_id":"cc2d33b2-30b3-4a3d-9087-042ebf2fee62","resolution":{"observed_at":"2026-08-07T12:40:27.471214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.455193Z","title":"Pile of law: Learning responsible data filtering from the law and a 256gb open-source legal dataset.Advances in Neural Information Processing Systems , 35:29217–29234, 2022","venue":null,"work_id":"a6455248-1bd2-4d26-8fdc-e16074d439bf","year":2022},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.342357Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:65c873a229bffa3004136acc71b50f65f2ed62eeacca411d9fcf93129121b673","observation_id":"524998d2-3a98-4b65-99c1-2dd8583bbe0a","resolution":{"observed_at":"2026-08-07T12:40:27.459928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06786","last_updated":"2023-10-10T16:57:28Z","snapshot_observed_at":"2026-08-13T05:52:51.072759Z","submitted_at":"2023-10-10T16:57:28Z","title":"OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06786","snapshot_observed_at":"2026-08-07T12:40:24.492611Z","title":"Openwebmath: An open dataset of high-quality mathematical web text.arXiv preprint arXiv:2310.06786 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.492611Z"},"links":{"cited_paper":"/paper/2310.06786","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:57257f7a04e002fc4b648665a5fe4bb1d5bab509157b139d267c78eff9265736","observation_id":"d09cf018-66b7-4013-89e9-aaaf55cc60bd","resolution":{"observed_at":"2026-08-07T12:40:24.492611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:24.639960Z","title":"Openwebtext corpus.http://Skylion007.github.io/OpenWebTextCorpus, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.639960Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:ac105bd15fdaaa5e91d7dc784fbc281f507979aad1f143f8578150b4c96222cc","observation_id":"a18c343b-6f9f-479d-bd70-10bd5032dfee","resolution":{"observed_at":"2026-08-07T12:40:24.639960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08786","last_updated":"2022-05-03T17:05:22Z","snapshot_observed_at":"2026-08-10T01:01:23.316486Z","submitted_at":"2021-12-16T11:09:29Z","title":"Efficient Hierarchical Domain Adaptation for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2112.08786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08786","snapshot_observed_at":"2026-08-07T12:40:26.676081Z","title":"Efficient Hierarchical Domain Adaptation for Pretrained Language Models","venue":"cs.CL","work_id":"2986f569-0e98-4a23-87cb-8da85171e404","year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.757051Z"},"links":{"cited_paper":"/paper/2112.08786","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:2b7c7bcfdd5609bdad39c1658b6414e2cbacc62ed24c20542d91b7c73f1746fb","observation_id":"4eede3ac-a845-4b0c-9f0b-a20b36f93a73","resolution":{"observed_at":"2026-08-07T12:40:26.744067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11499","last_updated":"2020-11-23T16:00:42Z","snapshot_observed_at":"2026-08-08T12:34:41.434586Z","submitted_at":"2020-11-23T16:00:42Z","title":"Unsupervised Domain Adaptation of a Pretrained Cross-Lingual Language Model","version":1},"cited_work":{"arxiv_id":"2011.11499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.11499","snapshot_observed_at":"2026-08-07T12:40:26.490234Z","title":"Unsupervised Domain Adaptation of a Pretrained Cross-Lingual Language Model","venue":"cs.CL","work_id":"c96d5335-e3bf-4801-8d60-f8d0ae3921fc","year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.874023Z"},"links":{"cited_paper":"/paper/2011.11499","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:6a99878e70abe335a9ac9a47070cf625fb284a11ff876799bb67eec990bdea6a","observation_id":"f1304c0c-a8c7-4e9b-84bc-03d556617291","resolution":{"observed_at":"2026-08-07T12:40:26.595401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01739","last_updated":"2020-10-05T01:49:47Z","snapshot_observed_at":"2026-08-08T21:58:06.382912Z","submitted_at":"2020-10-05T01:49:47Z","title":"Effective Unsupervised Domain Adaptation with Adversarially Trained Language Models","version":1},"cited_work":{"arxiv_id":"2010.01739","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.01739","snapshot_observed_at":"2026-08-07T12:40:26.228060Z","title":"Effective Unsupervised Domain Adaptation with Adversarially Trained Language Models","venue":"cs.CL","work_id":"7f717ba9-dd57-4e87-a5c6-6531ee76c498","year":2020},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:24.989842Z"},"links":{"cited_paper":"/paper/2010.01739","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:4f7bc4a04a29142471e8f4206f287f16ba85c12b40bd2707f93b2ba4bbd2122b","observation_id":"377d1690-53c8-4f96-bc5a-5f4d6375b1cd","resolution":{"observed_at":"2026-08-07T12:40:26.349803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.327506Z","title":"Taming pre-trained language models with n-gram representations for low-resource domain adaptation","venue":null,"work_id":"7bb107de-14c3-4092-9fc8-73d65d077d09","year":2021},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.065622Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:a96eb934e1d4e6573a33f6815b83f727e348132c1919a585181be3e367e1e74e","observation_id":"f77d5e94-3af4-4021-ab8b-ad69c2b76e30","resolution":{"observed_at":"2026-08-07T12:40:27.380758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10879","last_updated":"2023-02-21T18:54:21Z","snapshot_observed_at":"2026-07-06T14:54:15.390552Z","submitted_at":"2023-02-21T18:54:21Z","title":"$k$NN-Adapter: Efficient Domain Adaptation for Black-Box Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10879","snapshot_observed_at":"2026-08-07T12:40:25.154848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.154848Z"},"links":{"cited_paper":"/paper/2302.10879","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:ff55f6a212fe8d5a1675b4d56ea5930e9d03ca0dfa66453fa6a055b31d6b4efd","observation_id":"c681321b-25d0-4ae3-aa35-cdf10623bde8","resolution":{"observed_at":"2026-08-07T12:40:25.154848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09246","last_updated":"2023-05-16T07:52:57Z","snapshot_observed_at":"2026-08-05T06:19:25.316529Z","submitted_at":"2023-05-16T07:52:57Z","title":"Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09246","snapshot_observed_at":"2026-08-07T12:40:25.256358Z","title":"Maybe only 0.5% data is needed: A preliminary exploration of low training data instruction tuning.arXiv preprint arXiv:2305.09246, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.256358Z"},"links":{"cited_paper":"/paper/2305.09246","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:dcb2c4650ec8cfe3fae602d9b2841a9c8c99d8e3bc8920ddd0f10593960fb107","observation_id":"a36c054a-8148-4258-b397-d8431c44bc66","resolution":{"observed_at":"2026-08-07T12:40:25.256358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04212","last_updated":"2024-04-05T16:42:28Z","snapshot_observed_at":"2026-08-13T00:36:56.279260Z","submitted_at":"2024-04-05T16:42:28Z","title":"Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation","version":1},"cited_work":{"arxiv_id":"2404.04212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04212","snapshot_observed_at":"2026-08-07T12:40:25.995616Z","title":"Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation","venue":"cs.CL","work_id":"090325aa-75d3-47f6-b86d-836c3a7871d7","year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.450479Z"},"links":{"cited_paper":"/paper/2404.04212","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:6e19ba46d219c5caffb839514239a7d5c8372e666c41de1cfd28be87516071e1","observation_id":"85ad0bf9-ec45-4b43-851f-dc2ee4ff90f2","resolution":{"observed_at":"2026-08-07T12:40:26.067733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17193","last_updated":"2024-02-27T04:18:49Z","snapshot_observed_at":"2026-08-13T04:09:29.422300Z","submitted_at":"2024-02-27T04:18:49Z","title":"When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17193","snapshot_observed_at":"2026-08-07T12:40:25.565467Z","title":"When scaling meets llm finetuning: The effect of data, model and finetuning method.arXiv preprint arXiv:2402.17193 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.565467Z"},"links":{"cited_paper":"/paper/2402.17193","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:4b4119d134fce016033315d2a936c29ebd879315a08a31f522faab596329d6a6","observation_id":"0caa0043-5f84-482e-b6ae-cc4d4164c229","resolution":{"observed_at":"2026-08-07T12:40:25.565467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13669","last_updated":"2024-05-28T06:39:17Z","snapshot_observed_at":"2026-08-13T04:13:50.981825Z","submitted_at":"2024-02-21T10:06:08Z","title":"Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13669","snapshot_observed_at":"2026-08-07T12:40:25.692005Z","title":"Self-distillation bridges distribution gap in language model fine-tuning.arXiv preprint arXiv:2402.13669 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.692005Z"},"links":{"cited_paper":"/paper/2402.13669","citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:d20ab83f2330aaa5ff0ee95aa7d811873898c972c605b7671ced3dfef8de7388","observation_id":"1b8f02e8-aba9-43d0-b476-ed70cce6d159","resolution":{"observed_at":"2026-08-07T12:40:25.692005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.180770Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":"80f3649b-70e4-434b-a55e-6d76e0acacd7","year":2017},"citing_paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:25.825552Z"},"links":{"citing_paper":"/paper/2506.15702"},"observation_digest":"sha256:218649d55487b37e41eb089755302d47d5d799084e842462c41d39514668ceca","observation_id":"2280a8ac-60dc-470b-82a0-579ba4d0cba4","resolution":{"observed_at":"2026-08-07T12:40:27.239667Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15702","last_updated":"2025-05-30T01:54:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T18:09:50.294615Z","submitted_at":"2025-05-30T01:54:12Z","title":"Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":5,"verified_fuzzy":8},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.15702."}