{"as_of":"2026-08-21T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8d4346901617ca46d6ee16908b6ac0692657ff465dee0937efabdc837c1ab0d","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:14:33.817036Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.16056/citation-record","integrity":"/paper/2504.16056/integrity","json":"/paper/2504.16056/citation-record.json","paper":"/paper/2504.16056"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.210698Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.210698Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ee248402d7f0ef6cf3766e9ebbfd37280ad73e5e4abacb9263174d649c9b533a","observation_id":"98b69021-97a2-44e2-9763-6abb1118bb58","resolution":{"observed_at":"2026-08-16T11:14:33.210698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.219284Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.219284Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:0a32f0d3c563dbbb8acc0ce75407107a41f055dc826110563276e250aaaa0fcb","observation_id":"b1812db4-a0bc-4667-ad44-fd6c7278b68a","resolution":{"observed_at":"2026-08-16T11:14:33.219284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.224801Z","title":"How many data points is a prompt worth?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.224801Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:3c864ec463edf202126722e8ea2fed7cc8eeaa438e2ab5402dfa4071d6f86893","observation_id":"f3966a9c-5b91-4152-b30a-b478383c6509","resolution":{"observed_at":"2026-08-16T11:14:33.224801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08484","last_updated":"2022-03-15T01:52:38Z","snapshot_observed_at":"2026-08-18T16:19:51.720988Z","submitted_at":"2021-10-16T06:07:59Z","title":"A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08484","snapshot_observed_at":"2026-08-16T11:14:33.230226Z","title":"A good prompt is worth millions of parameters? low-resource prompt-based learning for vision-language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.230226Z"},"links":{"cited_paper":"/paper/2110.08484","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:523eeb4583d6f0c5bbe2c1c8f384494b9486f1b7e7410b97b6bf103f72c4b320","observation_id":"2f3a4864-4e04-447b-a013-b6613aa6a73b","resolution":{"observed_at":"2026-08-16T11:14:33.230226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.237630Z","title":"Orca 2: Teaching small language models how to reason,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.237630Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:80b797624740961517565e801498e170745723602e95a0c9eeaa49b354d05bac","observation_id":"18db569c-24c1-45ec-bd85-31d81a8856fe","resolution":{"observed_at":"2026-08-16T11:14:33.237630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.243258Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.243258Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:afb01c2a85f24511e36404ebcaacd9f2b51bea4eddde678bb163f67d715a20b2","observation_id":"88e77e2b-a18d-43a1-a0fc-3035525f1d79","resolution":{"observed_at":"2026-08-16T11:14:33.243258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.253840Z","title":"Tree of thoughts: deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.253840Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c10424aa73544e373bbcc9c18f45f73b9e4333cefb07c8c26926e1aa8884bb49","observation_id":"d769a000-8baa-4909-add5-02b14e90f632","resolution":{"observed_at":"2026-08-16T11:14:33.253840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16478","last_updated":"2024-04-25T10:03:14Z","snapshot_observed_at":"2026-08-17T06:16:46.131999Z","submitted_at":"2024-04-25T10:03:14Z","title":"Evaluating Consistency and Reasoning Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16478","snapshot_observed_at":"2026-08-16T11:14:33.262619Z","title":"Evaluating Consistency and Reasoning Capabilities of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.262619Z"},"links":{"cited_paper":"/paper/2404.16478","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f251d9e213c90419984a59ad750159a1dfe3b03bba4f996bdfd71928fbd28e23","observation_id":"40c8ec38-e37d-48a2-884c-197e34eba25c","resolution":{"observed_at":"2026-08-16T11:14:33.262619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.271377Z","title":"LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.271377Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f586d1673053fb8da27174bbe8d192dd3a87a8f9dc2589107f4fe74b78fccd2a","observation_id":"f3757aab-b2ac-4f54-8036-bfe20918ac78","resolution":{"observed_at":"2026-08-16T11:14:33.271377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.278489Z","title":"Towards a Mechanistic Interpretation of Multi-Step Reasoning Capabilities of Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.278489Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e03a1dbbdb6f448b0ef4fbfd727102f681894e373291ef0a3869fa43fef6c8c9","observation_id":"e19bff66-49ed-4f99-af76-1264f20f4c32","resolution":{"observed_at":"2026-08-16T11:14:33.278489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-16T11:14:33.286742Z","title":"Large Language Models: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.286742Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4311a306501ad4cce5c5a96c7e1e36aa4e3a6afad10934e70bbe3892fe410166","observation_id":"36bb8b42-14b4-4dbb-9604-457fedc2b329","resolution":{"observed_at":"2026-08-16T11:14:33.286742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-16T11:14:33.295471Z","title":"PaLM: Scaling Language Modeling with Pathways,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.295471Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:5b43dda22ed3adee7b07b5afe29550578b5c0bc79545133b5ed243619f169637","observation_id":"d711e744-6740-4214-9a2a-d4fa81a14483","resolution":{"observed_at":"2026-08-16T11:14:33.295471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12136","last_updated":"2019-03-28T17:23:50Z","snapshot_observed_at":"2026-08-14T16:55:13.315157Z","submitted_at":"2019-03-28T17:23:50Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12136","snapshot_observed_at":"2026-08-16T11:14:33.305643Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.305643Z"},"links":{"cited_paper":"/paper/1903.12136","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:0ff793b9d502591362eed0925a6b074ad24ab94ad07ad19a846d81a8fbe1d082","observation_id":"5f8d12ff-88b8-4e3b-ada2-ec0858bbe784","resolution":{"observed_at":"2026-08-16T11:14:33.305643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.312409Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.312409Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c2cb76f98629e7dbfb5e41f89dbdfb862edcf9dbeb5c6030445bc239c0994706","observation_id":"0c1b7307-c6b4-46b2-b806-67ef6513496a","resolution":{"observed_at":"2026-08-16T11:14:33.312409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.318425Z","title":"A survey on model compression for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.318425Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:542b2926c7f63f14ee0c3d971eed4dd144604c28fac50fc5d20ab812ba68d43d","observation_id":"ae1240ab-bf61-4e4b-8bd5-08dac906f5d8","resolution":{"observed_at":"2026-08-16T11:14:33.318425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1062328","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.447187Z","title":"Robustness-Reinforced Knowledge Distillation With Correlation Distance and Network Pruning,","venue":null,"work_id":"4fed3811-eb6c-44ca-aa51-d99d58313679","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.330242Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ee6ddfdd6d555580296c6b59f16f6d0c4c1b6a4a7484b60994f8a549b41be26f","observation_id":"fc464acc-3672-4d20-8166-1b425735dad7","resolution":{"observed_at":"2026-08-16T11:14:35.465463Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-08-17T13:50:40.586963Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-16T11:14:33.335551Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.335551Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f6e1ccba20d11ef081b16748907793a1d102839b1b195038d347d1de2e38174f","observation_id":"205069e1-d13f-4f4a-bf81-09b72aac1138","resolution":{"observed_at":"2026-08-16T11:14:33.335551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1047552","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.313155Z","title":"PanDa: Prompt Transfer Meets Knowledge Distillation for Efficient Model Adaptation,","venue":null,"work_id":"1adbdfbe-5d57-4b4b-90c3-3e0cd0b435c7","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.343242Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f1d8648506d395aa448361e9e88af8a9f6708baa466d7d92d69054d707b223dc","observation_id":"dbdf1f77-978b-49a2-a739-23cf6e579ac4","resolution":{"observed_at":"2026-08-16T11:14:35.326248Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12586","last_updated":"2024-09-19T09:09:53Z","snapshot_observed_at":"2026-08-16T13:17:14.700018Z","submitted_at":"2024-09-19T09:09:53Z","title":"Efficient Knowledge Distillation: Empowering Small Language Models with Teacher Model Insights","version":1},"cited_work":{"arxiv_id":"2409.12586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12586","snapshot_observed_at":"2026-08-16T11:14:35.228051Z","title":"Efficient Knowledge Distillation: Empowering Small Language Models with Teacher Model Insights","venue":"cs.CL","work_id":"799b3cbe-21d1-46ad-9426-8d6aeb3f85c4","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.349173Z"},"links":{"cited_paper":"/paper/2409.12586","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:51e0db076b6906f5c1626bd461351581d6337c787789836deefc1058becf9b9c","observation_id":"7be016a7-3828-4fea-b47e-b9df5de62d82","resolution":{"observed_at":"2026-08-16T11:14:35.235959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.694639Z","title":"Improve Student‘s Reasoning Generalizability through Cascading Decomposed CoTs Distillation,","venue":null,"work_id":"0a43ec2f-7b5b-4889-b403-9d8d6dba3444","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.355639Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c74324200773bb49d19c441c73b2e7108ec38858c6ede392b0dcdd72d2ae5bc2","observation_id":"7f2bdad9-662d-4356-9eae-b177258ab2b4","resolution":{"observed_at":"2026-08-16T11:14:36.701126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19737","last_updated":"2024-05-30T06:32:11Z","snapshot_observed_at":"2026-08-21T03:36:37.286293Z","submitted_at":"2024-05-30T06:32:11Z","title":"Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19737","snapshot_observed_at":"2026-08-16T11:14:33.362273Z","title":"Beyond imitation: Learning key reasoning steps from dual chain-of-thoughts in reasoning distillation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.362273Z"},"links":{"cited_paper":"/paper/2405.19737","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:b3a0420f2b352c0177d1eccb319d7ae9fcdc69b2dfd8b311409d710033932618","observation_id":"6f514958-2a04-47f7-8def-6d790ed36f17","resolution":{"observed_at":"2026-08-16T11:14:33.362273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.676897Z","title":"One teacher is enough? pre-trained language model distillation from multiple teachers,","venue":null,"work_id":"b5ec37cf-0289-44e5-a3e7-2fa966778670","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.376497Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4b3392e895cf8f0454ae58b45443f3cd8fa0e69cc0a5d98b66cfad2bff6ba5f6","observation_id":"68424ea8-48fd-4ce2-8154-e08f800a1ae8","resolution":{"observed_at":"2026-08-16T11:14:36.682170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19737","last_updated":"2024-05-30T06:32:11Z","snapshot_observed_at":"2026-08-21T03:36:37.286293Z","submitted_at":"2024-05-30T06:32:11Z","title":"Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19737","snapshot_observed_at":"2026-08-16T11:14:33.370369Z","title":"Available: https://doi.org/10.48550/arXiv.2405.19737","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.370369Z"},"links":{"cited_paper":"/paper/2405.19737","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e6c95aaf69d75d13bf5da9be9f0094ba3b29de32f5c907bed90ba8f697867a59","observation_id":"32b23400-321c-4d2b-8556-6adc88e07744","resolution":{"observed_at":"2026-08-16T11:14:33.370369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.658066Z","title":"We’re getting a better idea of AI’s true carbon footprint,","venue":null,"work_id":"208951a6-4229-4838-9ac1-449ad8fcf8b8","year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.390193Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f58ec49a43defc6b6b4d83f7e8e5fb499bb876854f97c213d4dac5c9bfc682cf","observation_id":"9d81e9cb-a2f6-4b01-a567-0d722665be01","resolution":{"observed_at":"2026-08-16T11:14:36.664620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.383447Z","title":"Distilling Large Vision-Language Model with Out-of-Distribution Generalizability ,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.383447Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:4de17082c3fa6dd31ddde817e80d37e4e11efe79c623093e69d9764afcb93051","observation_id":"2baef9c0-9ad5-4038-971c-bc99aadde51f","resolution":{"observed_at":"2026-08-16T11:14:33.383447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04751","last_updated":"2023-10-30T20:36:20Z","snapshot_observed_at":"2026-08-18T00:43:31.620959Z","submitted_at":"2023-06-07T19:59:23Z","title":"How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04751","snapshot_observed_at":"2026-08-16T11:14:33.401221Z","title":"How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.401221Z"},"links":{"cited_paper":"/paper/2306.04751","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9be46750aff11b7b7c3ffecb9bf1b033d7b9e0049922264f5061691fdaa584ad","observation_id":"a5d1de52-e38c-4275-b0d1-b30bed9c1900","resolution":{"observed_at":"2026-08-16T11:14:33.401221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.635904Z","title":"Energy and policy considerations for modern deep learning research,","venue":null,"work_id":"54ae6f67-9b7e-4d23-80e2-b3cd9c7a76f9","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.395348Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:10294973f3373018eb9c71f71a1ff3504454bff6fdff336e29df4a3ea3b6c899","observation_id":"7b777eb8-5b55-4c68-be52-747a82cf7873","resolution":{"observed_at":"2026-08-16T11:14:36.642068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.617970Z","title":"Towards a rigorous science of interpretable machine learning,","venue":null,"work_id":"73e48a78-a069-4805-8d64-759ee4c57550","year":2017},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.415619Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9fe960a94a9b6d74647beeabe45372a268dee257ba3418718eff47cc267e076f","observation_id":"ef9a79be-8a3d-457c-90f4-63ee2fefb9ad","resolution":{"observed_at":"2026-08-16T11:14:36.623378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-16T11:14:33.409305Z","title":"Code Llama: Open Foundation Models for Code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.409305Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:dd6fbabff506ff72380640066515a5812d7f107a2c19f33da7a30b3670380720","observation_id":"2f72d52e-be27-4dd7-9f02-6c71301c8668","resolution":{"observed_at":"2026-08-16T11:14:33.409305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04729","last_updated":"2025-01-09T12:44:44Z","snapshot_observed_at":"2026-08-17T22:26:30.674273Z","submitted_at":"2024-01-09T18:59:47Z","title":"Human Delegation Behavior in Human-AI Collaboration: The Effect of Contextual Information","version":3},"cited_work":{"arxiv_id":"2401.04729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04729","snapshot_observed_at":"2026-08-16T11:14:34.936955Z","title":"Human Delegation Behavior in Human-AI Collaboration: The Effect of Contextual Information","venue":"cs.HC","work_id":"5ed56bf0-f906-4c1a-9e27-88d4a70d22b3","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.429650Z"},"links":{"cited_paper":"/paper/2401.04729","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e480b02a6e6d9535e61666572f2797a8298b4c0c44d561b503111c8afca61aa0","observation_id":"a0859352-8950-41cf-87d8-d7c3542e2479","resolution":{"observed_at":"2026-08-16T11:14:34.945203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20873","last_updated":"2024-10-28T09:45:34Z","snapshot_observed_at":"2026-08-19T09:10:36.305140Z","submitted_at":"2024-10-28T09:45:34Z","title":"Explainability in AI Based Applications: A Framework for Comparing Different Techniques","version":1},"cited_work":{"arxiv_id":"2410.20873","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20873","snapshot_observed_at":"2026-08-16T11:14:34.978006Z","title":"Explainability in AI Based Applications: A Framework for Comparing Different Techniques","venue":"cs.AI","work_id":"e93a9085-1f0a-4d90-b7cf-0034632c20d3","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.422214Z"},"links":{"cited_paper":"/paper/2410.20873","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e6fbacfaeae54cad69ee50d84fe41639eaafb5b2a8fe846ddecd3157e7ef63de","observation_id":"f388cb98-012c-41db-b296-e006bdcb0588","resolution":{"observed_at":"2026-08-16T11:14:34.987158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.574976Z","title":"Multimodal explanations: Justifying decisions and pointing to the evidence,","venue":null,"work_id":"19d5905c-7a07-42b1-b03c-554e35ac9b1c","year":2018},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.444498Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:af51dda2e877a1d50b3cedba7f03ca8433663be3a13448659f2dd06e061489b4","observation_id":"68e86581-1138-47e4-bf33-abba4f572450","resolution":{"observed_at":"2026-08-16T11:14:36.582192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.596073Z","title":"Textual explanations for self-driving vehicles,","venue":null,"work_id":"6fbfb50d-d893-4194-b856-c1ed82ba6d2c","year":2018},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.436517Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2acf20e5a91f3aa49c7174f233dc0c373feb70ba378e313c80adf35671ad978f","observation_id":"67acd858-bb00-4913-8335-0ff0bf6532d0","resolution":{"observed_at":"2026-08-16T11:14:36.603412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.550961Z","title":"SCOTT: Self-consistent chain-of-thought distillation,","venue":null,"work_id":"8cd09e0f-3fa7-497b-afd7-1476819419ef","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.457164Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9d06cf27407bd42269d9cb1e92d49ee962bd7b984379143f60d20ea84a4ce16e","observation_id":"24a31e83-23f5-48b4-8c34-884a9706401d","resolution":{"observed_at":"2026-08-16T11:14:36.557491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13566","last_updated":"2024-05-08T17:14:25Z","snapshot_observed_at":"2026-08-19T17:08:18.201923Z","submitted_at":"2023-07-25T15:19:36Z","title":"The Impact of Imperfect XAI on Human-AI Decision-Making","version":4},"cited_work":{"arxiv_id":"2307.13566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.13566","snapshot_observed_at":"2026-08-16T11:14:34.904372Z","title":"The Impact of Imperfect XAI on Human-AI Decision-Making","venue":"cs.HC","work_id":"48d29be2-777f-4100-87f4-107a76f62340","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.451101Z"},"links":{"cited_paper":"/paper/2307.13566","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:637e92a6eaae9efb1a89f283414f581aed8e34670e78d620fbf5d979733130d8","observation_id":"11020271-44dd-4c07-9a27-f2121b09e107","resolution":{"observed_at":"2026-08-16T11:14:34.911322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.528217Z","title":"GPT-NeoX-20B: An open-source autoregressive language model,","venue":null,"work_id":"32ab55dc-a4e9-47d3-b601-b38a93183dad","year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.470853Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:21217d18a499b4b17433253afde9837b8f323aa8a5e5413c54eb192cfa69eb58","observation_id":"e380decd-ef05-4d9c-bd54-89933584f5c1","resolution":{"observed_at":"2026-08-16T11:14:36.534008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T11:14:33.464536Z","title":"Constitutional AI: Harmlessness from AI Feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.464536Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:480e0472792cce18c2134d381922f9e2141bd7dcf1e9c8c75d1c8bbbae0d690c","observation_id":"d03cc4b7-2763-456b-9b92-07728ef5de20","resolution":{"observed_at":"2026-08-16T11:14:33.464536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.508160Z","title":"MiniLLM: Knowledge distillation of large language models,","venue":null,"work_id":"e41987a8-9108-489b-8631-bd75321761be","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.484866Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9b3a3c5cdb1248ea006a3807e0130e632debe14d1b12c7299c86b57c906d1a4b","observation_id":"8c5eeee1-4791-4d24-8e43-1c2e99c5ba13","resolution":{"observed_at":"2026-08-16T11:14:36.514086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T11:14:33.478311Z","title":"Distilling the Knowledge in a Neural Network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.478311Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:aafcaebc2650c8b30390ac6211e8ddda74ac5eb823bf485bd2c65e0901de9a1f","observation_id":"1dfe0a89-dace-4aa9-9165-a5fb0cfba560","resolution":{"observed_at":"2026-08-16T11:14:33.478311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.08436","last_updated":"2020-03-24T15:09:17Z","snapshot_observed_at":"2026-08-16T01:20:01.294737Z","submitted_at":"2020-03-18T18:59:31Z","title":"Collaborative Distillation for Ultra-Resolution Universal Style Transfer","version":2},"cited_work":{"arxiv_id":"2003.08436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.08436","snapshot_observed_at":"2026-08-16T11:14:34.787684Z","title":"Collaborative Distillation for Ultra-Resolution Universal Style Transfer","venue":"cs.CV","work_id":"90f939ae-3a8d-410a-8883-0073fa503928","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.499036Z"},"links":{"cited_paper":"/paper/2003.08436","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:38ef84e5202f1b747dcdb03ff2f968834789ff8c599b6c15f770918a81ee9662","observation_id":"ed1622c9-09f0-4769-b435-72e85aa870fc","resolution":{"observed_at":"2026-08-16T11:14:34.794436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.487505Z","title":"ERDL: Efficient Retrieval Framework Based on Distillation from Large Language Models,","venue":null,"work_id":"a6474ba7-85fe-40fb-8a6a-f061a8b2f190","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.491419Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:7003c9bad3da7c9f1db1bc98d995c7c83b814ae7a008bf2727b0f54a99270b20","observation_id":"e77b374e-b894-4c69-8e36-4e804050e515","resolution":{"observed_at":"2026-08-16T11:14:36.493565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.467795Z","title":"Learning Efficient Object Detection Models with Knowledge Distillation,","venue":null,"work_id":"1f5462da-aee1-493f-ba98-64ee42dacab6","year":2017},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.512642Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:b80b1f3dc07f62c9bfb451a6d7a1a5cb27f366913f1b41cf4234fb5f449d093b","observation_id":"4df334a1-f535-470c-8972-dd470626dbe9","resolution":{"observed_at":"2026-08-16T11:14:36.473530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.04457","last_updated":"2019-05-19T14:13:37Z","snapshot_observed_at":"2026-08-14T16:33:57.659180Z","submitted_at":"2019-05-11T06:23:51Z","title":"Triplet Distillation for Deep Face Recognition","version":2},"cited_work":{"arxiv_id":"1905.04457","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.04457","snapshot_observed_at":"2026-08-16T11:14:34.754417Z","title":"Triplet Distillation for Deep Face Recognition","venue":"cs.CV","work_id":"68a24517-6e20-41aa-b828-adcd487fffef","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.505671Z"},"links":{"cited_paper":"/paper/1905.04457","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f657d7f737bcdd151fb107750351cafa7c58012bc2bc48194811dee24bc42b3d","observation_id":"7258449e-ce62-4ddb-b21a-61a3e922586d","resolution":{"observed_at":"2026-08-16T11:14:34.760921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.448852Z","title":"Training Compact Models for Low Resource Entity Tagging using Pre-trained Language Models,","venue":null,"work_id":"b1c2db1d-ee99-4900-9bc4-eb3646e95557","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.526719Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:aa5c20ec6dd422574268278af93c25cffc5a49be3fc75519da16e1b81d53440e","observation_id":"ff7ee1f4-7ecc-407f-a6f4-453edda60d00","resolution":{"observed_at":"2026-08-16T11:14:36.455034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-21T09:34:41.269688Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-16T11:14:33.519953Z","title":"A Survey on Knowledge Distillation of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.519953Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9bba57a61ba24b1a014535d133c13fd83cb5579a5031d817e9ef363d3d2fb95b","observation_id":"9b1ab665-5a3e-4740-aa82-e97f7594d065","resolution":{"observed_at":"2026-08-16T11:14:33.519953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.541136Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.541136Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f6c9457ac1005723b0b59f2aa35624dbd12fe7c3875ae6320aa58aca76cdfc2d","observation_id":"fae3d5ec-891f-44c9-8386-4323c85d1ab5","resolution":{"observed_at":"2026-08-16T11:14:33.541136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.533713Z","title":"On the effectiveness of adapter-based tuning for pretrained language model adaptation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.533713Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:96627e8d85a9045fd69d2d865f1355ed934efeeed2981623e22120948c80ec97","observation_id":"076b0ddf-f35d-4b9b-abca-75a1a6637a35","resolution":{"observed_at":"2026-08-16T11:14:33.533713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.415462Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning,","venue":null,"work_id":"49e9f2fb-0d59-43dc-b2b8-54ac453dd1fc","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.563083Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:157a9a9236dea53c9345aafec75d2bf1841ec17837ccbbff0b62802786256a48","observation_id":"5a332118-3ebb-4b38-aba3-8ad410930bb6","resolution":{"observed_at":"2026-08-16T11:14:36.422585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1072951","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:34.612947Z","title":"Efficiency Optimization of Large-Scale Language Models Based on Deep Learning in Natural Language Processing Tasks,","venue":null,"work_id":"139087f2-38d0-46c1-bc7d-a3a2e8cb6c6a","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.570311Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:fe91fa3843dfe011d285d645a5417d7a2ba5eee3343d3ef7c396d46c23b17dfb","observation_id":"829b6fe7-5bef-4449-b3d6-20d866f33253","resolution":{"observed_at":"2026-08-16T11:14:34.636249Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19486","last_updated":"2024-06-27T19:02:41Z","snapshot_observed_at":"2026-08-19T10:10:11.105476Z","submitted_at":"2024-06-27T19:02:41Z","title":"LoPT: Low-Rank Prompt Tuning for Parameter Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19486","snapshot_observed_at":"2026-08-16T11:14:33.555181Z","title":"LoPT: Low-Rank Prompt Tuning for Parameter Efficient Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.555181Z"},"links":{"cited_paper":"/paper/2406.19486","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:39e946f763ac9e1affff943ec7ac3684a3ac7d8aa2295821681f7ab639ddc099","observation_id":"2726a0e4-0f88-476d-aebf-8984ffc4d260","resolution":{"observed_at":"2026-08-16T11:14:33.555181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.583008Z","title":"A survey on the explainability of su- pervised machine learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.583008Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:820e99acc66a14673e2be5a67c920dd9ffdcc448b6950294b82168b28fea74bf","observation_id":"23af0cdf-774c-438c-8714-91bc58b841d1","resolution":{"observed_at":"2026-08-16T11:14:33.583008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.349604Z","title":"Baize: An Open- Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data,","venue":null,"work_id":"7b76587e-b034-4a05-9ddd-bc4483c59e62","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.588971Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c3fb5e1e6b8b8a4efaa77df71fd32ca2ec30cf788224514cd49a8614d3315357","observation_id":"e0b18b51-2d2f-4dc3-b554-1c944bd67083","resolution":{"observed_at":"2026-08-16T11:14:36.356019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.390026Z","title":"Causability and explainability of artificial intelligence in medicine,","venue":null,"work_id":"066f47cc-cff3-4f15-85fa-05c2b115cd86","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.576472Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:7518ade8fa103b349a1e0d486abecf9aca65447fee4ae650cd2e2cb74a03a06b","observation_id":"128b23c6-9508-4834-8853-a7a723bfff32","resolution":{"observed_at":"2026-08-16T11:14:36.398035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-20T18:24:48.267958Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-16T11:14:33.602378Z","title":"Large Language Models Are Reasoning Teachers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.602378Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:10c601e15c607c762262b5c574ec6b466cfd0ee4a5a98a75fb10089705293db6","observation_id":"76cbda5e-7e7c-45f9-9ae2-008253d7765c","resolution":{"observed_at":"2026-08-16T11:14:33.602378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-08-20T03:55:16.111787Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-08-16T11:14:33.611181Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.611181Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:8daa677baa1ceacce863f1d37c38dbbdd70ae9bc19ca065f2ec00b4925ee9e07","observation_id":"457fff00-8fc6-4855-97f3-8a2b0e7d16e3","resolution":{"observed_at":"2026-08-16T11:14:33.611181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.329917Z","title":"Teaching small language models to reason,","venue":null,"work_id":"6168f4ba-c959-4708-b8f9-41d8897b63c2","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.595210Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:cc97b75da458012163f8ca08f6477a1023be077e074508c052db278a14b055a2","observation_id":"a1e58e14-d50d-4ebb-9a7d-0f3a7962c376","resolution":{"observed_at":"2026-08-16T11:14:36.334869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-16T11:14:33.623608Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.623608Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:53341a920125e0685b72c58845f46f144a887c1901d107c51352dabb76b8dff0","observation_id":"8e6492d4-5e75-457b-a33e-4f4584da72e2","resolution":{"observed_at":"2026-08-16T11:14:33.623608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.312129Z","title":"Explain Yourself! Leveraging Language Models for Commonsense Reasoning,","venue":null,"work_id":"cfab4afd-fa22-4354-8f1b-2deab78887a9","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.630185Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:257d548e4a771d0a5eee82eab3e7a054c14be7056e374176fb92d9291296a4ab","observation_id":"13966246-99c7-4232-ac64-bfcc5916e6f7","resolution":{"observed_at":"2026-08-16T11:14:36.317871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1050762","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:34.458444Z","title":"Sci-CoT: Leveraging Large Language Models for Enhanced Knowledge Distillation in Small Models for Scientific QA,","venue":null,"work_id":"b41d775b-61a7-47ba-8cbc-f4d3a84e0a7d","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.618376Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:47fbdd86aaa9f5b48c7dd1d0d7e3d940a2c21a52214136010963b2a92e1d9ba6","observation_id":"0556d3fa-430b-4d1d-ba92-7e91b014fb34","resolution":{"observed_at":"2026-08-16T11:14:34.469818Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12434","last_updated":"2020-02-14T22:32:46Z","snapshot_observed_at":"2026-07-06T08:25:01.425019Z","submitted_at":"2019-09-26T23:25:25Z","title":"Learning the Difference that Makes a Difference with Counterfactually-Augmented Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12434","snapshot_observed_at":"2026-08-16T11:14:33.643474Z","title":"Learning the Difference that Makes a Difference with Counterfactually-Augmented Data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.643474Z"},"links":{"cited_paper":"/paper/1909.12434","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1303ed0b62e43eda1ac9f54d365c303ecd249f5b1af26bc041e86bb963e79d0e","observation_id":"2e8d94af-f530-4c5b-9e07-3c4d058a8757","resolution":{"observed_at":"2026-08-16T11:14:33.643474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.276971Z","title":"Measuring Association Between Labels and Free-Text Rationales,","venue":null,"work_id":"51ab3e0b-0964-48e0-ad60-0eaa15f7ceb6","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.649662Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:c226e98dfb3174559f4ea6f264ef495017fa085850691c307b842c95d3683b50","observation_id":"4ebb9732-bf28-439a-a787-f4e1514b22ba","resolution":{"observed_at":"2026-08-16T11:14:36.282778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.636237Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.636237Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:03bb7c87e30c849cec15d0248990f03809dc27fa87ffd354352bec58c0181646","observation_id":"225e2463-0cf3-436e-beba-c3269bd93350","resolution":{"observed_at":"2026-08-16T11:14:33.636237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:14:33.660941Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.660941Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:1040a8d32c54f80aec0d03444bc734370eb4015cff09ca668d795d6799a9f2a6","observation_id":"ac008d29-186c-4110-8306-28d05d17f829","resolution":{"observed_at":"2026-08-16T11:14:33.660941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.234279Z","title":"RLCD: Reinforcement learning from contrastive distillation for LM alignment,","venue":null,"work_id":"cd72ef1f-018d-436e-97c8-ed13e1a827dd","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.666797Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:a05dd1608fafddb6848ab48f924f7b98302447d236329915556980e943c46a7d","observation_id":"8c144fd8-b7ff-4474-895d-920041793ea7","resolution":{"observed_at":"2026-08-16T11:14:36.240089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.256165Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge,","venue":null,"work_id":"29922526-c024-4f80-9a3c-8a14632468f1","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.655062Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:decaa37bfee90c196550865413413e78493e6ea16b0ab187d9e9c9e3df1a7a0e","observation_id":"00338ae6-a98f-43e8-b63b-8e589f616ace","resolution":{"observed_at":"2026-08-16T11:14:36.262504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.687221Z","title":"Transformers: State- of-the-art natural language processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.687221Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:426f4addc0a51d142e0291b51db4917678d88ea38b6e30f58b2bc99996386bef","observation_id":"9cca6e39-e9fc-45cb-94d1-cd1e82167214","resolution":{"observed_at":"2026-08-16T11:14:33.687221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.156971Z","title":"Generating visual explanations,","venue":null,"work_id":"34258814-310f-49c9-9fa8-edcb919c2ed8","year":2016},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.692926Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:31be69ea37cbd5ce09beea7eb2aa0af100eac0c9cf6416d994941f639654c70f","observation_id":"c803238b-ad20-4141-b4cb-60ecf4a4824a","resolution":{"observed_at":"2026-08-16T11:14:36.164806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.215010Z","title":"Available: https://openreview.net/forum?id=v3XXtxWK i6","venue":null,"work_id":"1d95fade-73d5-4deb-9b88-5554d073f281","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.675136Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e8c2c5f2034c973104a0bbf59ad8d280275811bb8695f0772bad4f8df238d97f","observation_id":"a63a36d2-7f36-4705-b61a-13668f557077","resolution":{"observed_at":"2026-08-16T11:14:36.220722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.195549Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"6af4736c-2e5b-420b-8e96-528bc0a39353","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.681286Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f22372362a070aa50fba0e1b781b3400f960c2a6c9b07ae2dfe4cd755ec793aa","observation_id":"e399f061-52f8-41d4-8839-b75f29a21de7","resolution":{"observed_at":"2026-08-16T11:14:36.201963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.086455Z","title":"Exploring Evaluation Methods for Interpretable Machine Learning: A Survey,","venue":null,"work_id":"978641d8-b1e1-430d-96e6-137c53eb8797","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.719857Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:36e7edba8c848a1fa9a7dded4c711a1dca5e61a60a8153130934901a506bd509","observation_id":"25b23c66-30be-43f4-888b-61102579c7a2","resolution":{"observed_at":"2026-08-16T11:14:36.095461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.061292Z","title":"Evaluating the Quality of Machine Learning Explanations: A Survey on Methods and Metrics,","venue":null,"work_id":"ae9f7b66-ed44-4d1a-acae-08621e151aed","year":2021},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.725446Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:92bbe46fdb620b89dc0a5a11263f619d1d68ca657db81bc3e7930fa9d7b4e048","observation_id":"38a404bc-869c-48f6-97b9-0020d1087550","resolution":{"observed_at":"2026-08-16T11:14:36.069454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.135301Z","title":"Prolific · Quickly find research participants you can trust","venue":null,"work_id":"2d34e22d-cedb-44bc-8fd9-3296439530cb","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.699384Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:9e538310efd05f99cf7ef6798d2fb14487985a926cda964074b1892cd433fecf","observation_id":"dc10041a-86fe-41c6-8535-0ecd00ef424d","resolution":{"observed_at":"2026-08-16T11:14:36.141145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.011901Z","title":"Oxford Learner’s Dictionaries | Find definitions, trans- lations, and grammar explanations at Oxford Learner’s Dictionaries,","venue":null,"work_id":"0f64ce68-fa74-4cbb-b8fd-00ce22b89663","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.737626Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:e1aa97400424fc546c3336841ab1cf6de1595e3df5db3e6510aae03aed6f0a88","observation_id":"600d2bdd-8c55-4ce4-bfab-a46d63be6a6b","resolution":{"observed_at":"2026-08-16T11:14:36.019173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12254","last_updated":"2022-05-24T17:57:55Z","snapshot_observed_at":"2026-08-18T01:52:54.652019Z","submitted_at":"2022-05-24T17:57:55Z","title":"Interpretation Quality Score for Measuring the Quality of interpretability methods","version":1},"cited_work":{"arxiv_id":"2205.12254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12254","snapshot_observed_at":"2026-08-16T11:14:34.153278Z","title":"Interpretation Quality Score for Measuring the Quality of interpretability methods","venue":"cs.CL","work_id":"ad65aedf-b739-413c-98be-f73605dfb4ab","year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.714226Z"},"links":{"cited_paper":"/paper/2205.12254","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:d2f250cac91f360d1441eeaed72e71a351752934297985deb1218c9b7c7685ba","observation_id":"3d6068cb-7b34-457d-83f5-2b7b3bcd0778","resolution":{"observed_at":"2026-08-16T11:14:34.164010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.857633Z","title":"Machine Learning Interpretability: A Survey on Methods and Metrics,","venue":null,"work_id":"9b2358f7-2601-4274-ab96-04669edabd80","year":2019},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.754508Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:90df76c1ff6ae544453aaa06f71bd529ab52e4824ad8b6ae6de1c45be8f644f0","observation_id":"3fdea23a-9f9d-4a19-8025-a874fedfd1df","resolution":{"observed_at":"2026-08-16T11:14:35.884649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.818866Z","title":"Leakage-adjusted simulatability: Can models generate non-trivial explanations of their behavior in natural language?","venue":null,"work_id":"c330d54a-3fd5-4ecb-b596-71007b98bb61","year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.761904Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:5a7b62f5156982d4fad6f7c1f3bdd9dc43ea152cafd511422d1c934881794184","observation_id":"0805957b-667f-482a-9030-00eefd64f05d","resolution":{"observed_at":"2026-08-16T11:14:35.827792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.039094Z","title":"REV: Information-theoretic evaluation of free-text rationales,","venue":null,"work_id":"5b58cfad-0272-49b9-9326-77fa3843ec25","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.730855Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f6a6cff0bbda355b84181738b6a51250365b0c9900bcd0000387daa987bbc0ff","observation_id":"9f91952a-3cca-4886-b4d8-db24f7fb62e7","resolution":{"observed_at":"2026-08-16T11:14:36.046740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10059","last_updated":"2023-12-04T12:06:12Z","snapshot_observed_at":"2026-08-16T14:37:54.129627Z","submitted_at":"2023-12-04T12:06:12Z","title":"A collection of principles for guiding and evaluating large language models","version":1},"cited_work":{"arxiv_id":"2312.10059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.10059","snapshot_observed_at":"2026-08-16T11:14:33.967309Z","title":"A collection of principles for guiding and evaluating large language models","venue":"cs.CY","work_id":"c0d41a0d-4769-41ce-80cf-9e5f9d7a73a6","year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.774376Z"},"links":{"cited_paper":"/paper/2312.10059","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:06e2327904aa9e0259cbee899abde8c131f3f8c901ae589ee419282145b403fb","observation_id":"d339e3a7-ec55-4a88-ad0a-73714273e4a9","resolution":{"observed_at":"2026-08-16T11:14:33.976100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.941295Z","title":"Available: https://www.oxfordlearnersdictionaries.com/","venue":null,"work_id":"b630537f-fe50-4ad5-afd0-74237b5cdbe3","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.743200Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:ab3034074f41bca93faf115134ffb4f8150a0e86f7e3811694bafdab7ea028fd","observation_id":"323866e7-6e58-48dd-97be-eb133c228396","resolution":{"observed_at":"2026-08-16T11:14:35.974511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.748684Z","title":"Measures for explainable AI: Explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.748684Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:71c813df7e5031680e72699c0f1bfed29eb347b9c4b0a6230236455252372f2b","observation_id":"3ebabbc5-7f53-4593-b2dd-b92b6aead322","resolution":{"observed_at":"2026-08-16T11:14:33.748684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.795484Z","title":"Exploratory Data Analysis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.795484Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:f22e3349f630da5ab7359226e6a243b0ca239776154c61f12fa3ca9a10ebc944","observation_id":"0d4e0bf6-5dc3-487e-a5b4-8c3402e7de39","resolution":{"observed_at":"2026-08-16T11:14:33.795484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.716863Z","title":"Likert scales, levels of measurement and the “laws","venue":null,"work_id":"c44cdb31-7f4e-4406-ba7b-2c8de3687e97","year":2010},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.802601Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:365ee0b0552e614f09dad4be6ed8d22b258926929a9bc4c354136211f39a88c8","observation_id":"3887b22d-771c-477c-8fa3-19ed49b8bfd4","resolution":{"observed_at":"2026-08-16T11:14:35.726383Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.767813Z","title":"Measuring the Quality of Explanations: The System Causability Scale (SCS): Comparing Human and Machine Explanations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.767813Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:53a295782c4f435ef0f30e95a125af4e5b9f37e4e8b4611aec9842a8fb591745","observation_id":"abc4232b-48fb-4a5f-a94a-b64a6411855a","resolution":{"observed_at":"2026-08-16T11:14:33.767813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.691474Z","title":"A Critique and Improvement of the","venue":null,"work_id":"cf799334-7b45-4821-b0e9-a2fc877414ab","year":2000},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.817036Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:a9b16c5a322107a082b52fbb810702ddb61f2aa431768ebb500bbce78d4cf649","observation_id":"c8523882-fc5c-4cef-b152-c000da61d6f0","resolution":{"observed_at":"2026-08-16T11:14:35.701353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.790109Z","title":null,"venue":null,"work_id":"c0c75ddb-9a23-4893-973c-e1d75f5fd95e","year":2008},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.781525Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6b60f17650f71b081c3b35d64970b3f314b068c7e5d1da5a7581d7effa4eb030","observation_id":"6c757055-83d5-4cc2-95ec-1101625928ac","resolution":{"observed_at":"2026-08-16T11:14:35.796676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:35.746062Z","title":"Bhattacherjee, Social Science Research: Principles, Methods and Practices","venue":null,"work_id":"d84280a3-a973-4957-bc01-c2ae50582ea3","year":2012},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.788564Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:02b5945afb390a3a1d90218ef59d51a92f2c007d5ad8cb70a6a91badc794bb7a","observation_id":"cf7422d9-6280-4b3d-bac9-58cef8b52da9","resolution":{"observed_at":"2026-08-16T11:14:35.760885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:33.809214Z","title":"Nonparametric Pairwise Multiple Comparisons in Independent Groups using Dunn’s Test,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.809214Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:571eb85155e29c4ab369c109954edbc617ee68d78319d05faa27e4b825e13d06","observation_id":"a9d35239-64ad-4710-94e2-32d6b5fc3f7c","resolution":{"observed_at":"2026-08-16T11:14:33.809214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T11:14:33.547063Z","title":"Available: https://arxiv.org/abs/2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.547063Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:6afb167f707a8b483c48d898963c3cde8b87aac899ca73c600b1014252609523","observation_id":"5e509fde-6c7c-4448-9ebc-7f118718c2d1","resolution":{"observed_at":"2026-08-16T11:14:33.547063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.114150Z","title":"Available: https://www.prolific.com/","venue":null,"work_id":"b92b4324-ba64-413b-9397-429371bd9679","year":null},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.706941Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:a8cb20f738b30de742d7f025ce92ec7f6ba9d7c91fd294bce37057e3eba730cd","observation_id":"1bdaa55b-5841-4e5e-8125-86452fe0a676","resolution":{"observed_at":"2026-08-16T11:14:36.121111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:36.713678Z","title":"Available: https://aclanthology.org/2024.tacl-1.85/","venue":null,"work_id":"2f99e64d-622f-4e08-a420-9423aaa773b6","year":2024},"citing_paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:33.324532Z"},"links":{"citing_paper":"/paper/2504.16056"},"observation_digest":"sha256:2180ac44bb2c1acf122973ea8b420149e3613117d4f2bc31afba8416e7ff125a","observation_id":"07ded7da-bf85-45ac-bbfc-2168717e6cdf","resolution":{"observed_at":"2026-08-16T11:14:36.719529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16056","last_updated":"2025-04-22T17:32:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T06:49:20.967307Z","submitted_at":"2025-04-22T17:32:48Z","title":"Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":12,"verified_fuzzy":36},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2504.16056."}