{"as_of":"2026-08-18T08:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:229b8ebf8befcc892eddd6851e404bf5f302e92b06e0b7b5a57082312f16b480","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:18:00.945501Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T03:11:23.755739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:36:55.530603Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.11120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11120","snapshot_observed_at":"2026-07-02T11:36:55.530603Z","title":"arXiv preprint arXiv:2506.11120 , year=","venue":null,"work_id":"d56ed360-e3e8-4d49-a5b4-621eeea9984d","year":null},"citing_paper":{"arxiv_id":"2606.05538","last_updated":"2026-06-04T00:43:20Z","snapshot_observed_at":"2026-08-12T18:39:40.723016Z","submitted_at":"2026-06-04T00:43:20Z","title":"Less is MoE: Trimming Experts in Domain-Specialist Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T03:11:23.755739Z"},"links":{"cited_paper":"/paper/2506.11120","citing_paper":"/paper/2606.05538"},"observation_digest":"sha256:5bc01b984c359ba574bc7eb10d0e6d9b69746047be2928faaf2962226f534cb7","observation_id":"a9f89fff-61e2-4123-91c0-10afe46d1e92","resolution":{"observed_at":"2026-07-02T11:36:55.532074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11120/citation-record","integrity":"/paper/2506.11120/integrity","json":"/paper/2506.11120/citation-record.json","paper":"/paper/2506.11120"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T05:18:00.602279Z","title":"The falcon series of open language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.602279Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:7e5fc7f51173e4cd83cd87ed6ea8f4645ff4668c7a71caa698634242adff515d","observation_id":"8812d6d3-7c5e-40da-bfcc-9d79c5dbb4b9","resolution":{"observed_at":"2026-08-07T05:18:00.602279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.824607Z","title":"Croci, Marcelo Gennari do Nascimento, Torsten Hoefler, and James Hensman","venue":null,"work_id":"a57ee492-a074-4b7b-8d62-c295cc4c9cde","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.614868Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:fcc07820d085e246b711cfb080b86ca412fdacef872bf06cd3bed6a652f6b466","observation_id":"e7b9fcf5-bad2-4041-9c7b-a2624ddeca42","resolution":{"observed_at":"2026-08-07T05:18:01.830614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.808086Z","title":"Qwen technical report, 2023","venue":null,"work_id":"006896e6-f8bc-4360-b625-7c2b18b891ee","year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.622330Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b0b5ef201d36b0a93788b9435d9bb55ce998c1f5cdc44c67d539f53c48137ed4","observation_id":"625657ed-3f20-46a8-bea3-6a25380d045a","resolution":{"observed_at":"2026-08-07T05:18:01.813948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.630472Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.630472Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:3649d12424cb3d54ec2c30789c0e87593e0999bfd3805e3e3c247ed5fecbff3d","observation_id":"e2f66436-8a7b-454e-a4be-f38f3def90df","resolution":{"observed_at":"2026-08-07T05:18:00.630472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.636791Z","title":"Piqa: Reasoning about physical common- sense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.636791Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:81a93519dbde50647718dd40870dbd54b32cb8f44a52e37a1485eb710fe8d9ba","observation_id":"25aaba19-f0c7-4f21-afb6-b08f48dce34e","resolution":{"observed_at":"2026-08-07T05:18:00.636791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.772512Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"4faa38f6-7b4e-461e-807f-123c4a552d25","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.643358Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:1171dfd679a94fb0516f5a33f0ab8ba7c636db3a875c13897b513c009dd365ab","observation_id":"1659951e-c763-42b4-8953-62918b8564d7","resolution":{"observed_at":"2026-08-07T05:18:01.777533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T05:18:00.653277Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.653277Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:55d988216e5ea04b0c1b746a7a3c73419bc33201836782552722cc059a1b14b7","observation_id":"18aa9670-509f-44fa-a0cb-9a964110588e","resolution":{"observed_at":"2026-08-07T05:18:00.653277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04902","last_updated":"2024-04-08T22:42:49Z","snapshot_observed_at":"2026-08-16T14:44:51.742877Z","submitted_at":"2023-11-08T18:59:54Z","title":"Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04902","snapshot_observed_at":"2026-08-07T05:18:00.659057Z","title":"Beyond size: How gradients shape pruning decisions in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.659057Z"},"links":{"cited_paper":"/paper/2311.04902","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:bf4aa0071f721b2fce0cb166943163d4b99856ddb1019fb1b90bb89f69d0bebe","observation_id":"b3033720-e6be-482f-9e37-2aab8f6bb45d","resolution":{"observed_at":"2026-08-07T05:18:00.659057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.756663Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":"a21b427b-4c76-4d2d-ac52-430c801b0c60","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.666262Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:5f479bc9ceb2e699e01c94cd5a9dea14f87bbaa3bbe56b6c8e5053890d97f0fb","observation_id":"a3a9c799-9d89-42b6-bf63-1e444515cd7e","resolution":{"observed_at":"2026-08-07T05:18:01.762396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.672644Z","title":"Optimal brain compression: A framework for accurate post-training quantization and pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.672644Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:1ae7b378eb57fceba5173642eca0ce08e315f7b177f7d73e728ff8ce5f43e0e8","observation_id":"a808ac6d-bae4-4ff6-b991-34dfee1ac399","resolution":{"observed_at":"2026-08-07T05:18:00.672644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.677706Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.677706Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:947d5e08cfdc4fe1e404d5a95d4e5725d279a85539dd5e16029cd50781768e92","observation_id":"6ce87ca3-bea8-44ba-b5fa-161a1611014a","resolution":{"observed_at":"2026-08-07T05:18:00.677706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.684957Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.684957Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:a7afab381d521e3dd28d146cbb6d026b64a719775ab3c4593ce751cbf2f08b4a","observation_id":"e292cc65-18ce-42d8-8cd5-bd0b839af4f8","resolution":{"observed_at":"2026-08-07T05:18:00.684957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.692310Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.692310Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:94ffcc2f18a7db6f1d5e30d47dd247a2660172fc73a310e5a52525207ebb3c25","observation_id":"acd6ca35-4a99-4286-8e0b-f0d78b5c9c7d","resolution":{"observed_at":"2026-08-07T05:18:00.692310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.701312Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"b3f2253e-ea8b-4820-acd8-0491d2dbb989","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.701411Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:77a5949e5ddd0fcc0d6123eaf9da9a0e45e369eabddf3b5769d34f26d961ace0","observation_id":"8203a861-e8d9-44a2-b227-cb706533c4b0","resolution":{"observed_at":"2026-08-07T05:18:01.706038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.684204Z","title":"Functionary","venue":null,"work_id":"bc426a6d-211e-4c75-ae10-ddd635647620","year":null},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.710063Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:4c40e2d53951a40cbdd2f10dda0ac7b2f9136c8ad63585c81e568994695b51db","observation_id":"1a70383c-f310-42fe-bf5e-62a421024e46","resolution":{"observed_at":"2026-08-07T05:18:01.689484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05015","last_updated":"2023-10-11T01:46:35Z","snapshot_observed_at":"2026-08-16T14:54:09.255818Z","submitted_at":"2023-10-08T05:16:28Z","title":"Compresso: Structured Pruning with Collaborative Prompting Learns Compact Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05015","snapshot_observed_at":"2026-08-07T05:18:00.717102Z","title":"Compresso: Structured pruning with collaborative prompting learns compact large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.717102Z"},"links":{"cited_paper":"/paper/2310.05015","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:41ccef7f1e7231a10fb7aac5dee9ea2530fa5379abf273afc45d1dcc770228f9","observation_id":"13c54924-4a5c-49da-ab09-b2bef57572b6","resolution":{"observed_at":"2026-08-07T05:18:00.717102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.667896Z","title":null,"venue":null,"work_id":"d4ae9b34-0018-4b35-8a59-655e1c04fb77","year":2015},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.729424Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:343876b4d1942b452cb5c60efdc7b24d6d7f9c86e4aa944ff55df937044804ae","observation_id":"cdddbc22-358d-4b2e-8324-6bb8e0923b03","resolution":{"observed_at":"2026-08-07T05:18:01.672515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.735598Z","title":"Optimal brain surgeon and general network pruning","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.735598Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:246b0da02bd27bd2b2f935a4ba6f374d867936fb6a1ed1aad2f2c573209dbc1e","observation_id":"7112f5ed-55fd-439d-b134-248144c36fec","resolution":{"observed_at":"2026-08-07T05:18:00.735598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.642864Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":"28dc3252-2927-46e7-81d0-1346fb1b6c2f","year":2017},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.743612Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:dfc7b96b3aca12bc8dc10df0aa28003f5f0c25196af4a914ef30cc347341f514","observation_id":"db8abe49-b88e-4662-b869-e79f8f769d9d","resolution":{"observed_at":"2026-08-07T05:18:01.647842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.626834Z","title":"Optimal brain damage","venue":null,"work_id":"8836304b-4dd3-4397-9d68-369158eece08","year":1989},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.749932Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:5fe5e2e7fc063c4ad128b9fb29fea7178b8cfc99414e450b0d764631d1f3b444","observation_id":"1ab74062-8c34-4389-b535-f339ec49b91f","resolution":{"observed_at":"2026-08-07T05:18:01.631729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.609052Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":"155c1031-b02b-414b-8915-4b95bbd7b254","year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.757400Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:184ab6cf94dde616d173cc1f068c80daf9c4d4b97993e7a4960158a05649dff3","observation_id":"20deb705-1069-49d0-8185-30a97ac91cfc","resolution":{"observed_at":"2026-08-07T05:18:01.615735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-16T14:16:07.202427Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-07T05:18:00.764648Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.764648Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:da9510f718044b04ea639b66b5871b95875d2dde877ef77ff26a6047146e9cbb","observation_id":"6e33137f-c3f4-4600-a6ad-f2b8f83dc5af","resolution":{"observed_at":"2026-08-07T05:18:00.764648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.772997Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.772997Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:1e7a6c9a874b75fc21f9540a05169e1f802bfc8ef0d34161fe086a72f71db176","observation_id":"12bc2919-2ee0-421a-9fde-c11ed2675af0","resolution":{"observed_at":"2026-08-07T05:18:00.772997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.578529Z","title":"OpenELM: An efficient language model family with open training and inference framework","venue":null,"work_id":"f3ee5e5c-3e4a-49f2-b2e8-2fa010faf497","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.779379Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:cf78585f06a1e5e0230f35ad3209b2d2cf25651d3ee02787c6035e8d7da7e197","observation_id":"a9981811-6034-4088-a6bf-49cddfa8b35a","resolution":{"observed_at":"2026-08-07T05:18:01.583411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.785284Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.785284Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:3b9e35d26b245774de8ef19f736e3f5f27fff49c4539767bbcd58d3574b153fb","observation_id":"76dda036-8239-434a-937c-789b849a60a4","resolution":{"observed_at":"2026-08-07T05:18:00.785284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.552675Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"b3235bb4-516b-4df1-8488-54e3d9891f06","year":2018},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.790067Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:5cc742f883b9d786c3b742be9df6632162485017b5a21e8c0573d11920403f0c","observation_id":"d8c25c6e-1fa4-4092-b4cd-4b61e61023e5","resolution":{"observed_at":"2026-08-07T05:18:01.557452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.536342Z","title":"Importance estimation for neural network pruning","venue":null,"work_id":"7cd11679-caf1-4d4e-988f-59c2ed6b4517","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.795500Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:6bc673ac7d2faeae06b4a5045a3188e68e4938065dec0a685d7d342574f96ab5","observation_id":"d9673bc7-7414-49cf-9e16-de23478d752e","resolution":{"observed_at":"2026-08-07T05:18:01.541531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-14T21:29:36.502364Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-07T05:18:00.800785Z","title":"Pruning convolutional neural networks for resource efficient inference","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.800785Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:f4b01374fc69d105ba812638a091502fe6137063f2cfbce7a4c671aec393f1ae","observation_id":"7ba3b960-9222-43a0-8481-ec61c2ce9944","resolution":{"observed_at":"2026-08-07T05:18:00.800785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.517467Z","title":"Skeletonization: A technique for trimming the fat from a network via relevance assessment","venue":null,"work_id":"1f57fa39-2296-44ff-8434-be9190f71694","year":1988},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.807319Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:0b99e5390b99f5fdc90b2c62904486df4695bb187ff3f204a761ce246d1c3064","observation_id":"eb1fd6d4-6c82-45b7-af3d-128aac6b52e5","resolution":{"observed_at":"2026-08-07T05:18:01.523255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.813987Z","title":"Compact language models via pruning and knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.813987Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:04203f349cfa6743a966e15d550d2fe5960abf9ffed1447bbb62c99c8d426b4b","observation_id":"08bbace6-84e0-48f8-853e-8cb4da6d71cc","resolution":{"observed_at":"2026-08-07T05:18:00.813987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.487495Z","title":"CrowS-pairs: A challenge dataset for measuring social biases in masked language models","venue":null,"work_id":"e229f8b6-9930-44f3-ac98-7674b0fc467f","year":2020},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.819573Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:0cb06e2ece2642312de36acae9599a00d9144b57a508303f75e7bded8f7be66a","observation_id":"2ace9761-2f78-45b3-b806-09152f3e7cf2","resolution":{"observed_at":"2026-08-07T05:18:01.495252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.467347Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"5b1d8204-bf84-4321-83cf-bc4054425111","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.824828Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:d487a8baed1ec67c9ab60fc2e04c2c60bf1ff62a333e3286e92a878c6eac9220","observation_id":"b0dc668a-ebc5-4f60-95fc-22f0bf1e9ff9","resolution":{"observed_at":"2026-08-07T05:18:01.474197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.450259Z","title":"Revisiting self-distillation, 2022","venue":null,"work_id":"9b35b305-1969-433a-9617-c41e47626d73","year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.829627Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:8b865de25e8b3a4c7ef6bf07e3f67feedee085b9466d2cfcdd0e809109b10d78","observation_id":"f1c0aca5-51f3-4f0e-9e81-b5c562c95525","resolution":{"observed_at":"2026-08-07T05:18:01.455223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.836703Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.836703Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:b23b0f6e5a315b64b6b67ebb6b2555548db329e378760d2619045bec34d8c132","observation_id":"0f9e8d22-86fe-4229-bb1d-1976fd5043be","resolution":{"observed_at":"2026-08-07T05:18:00.836703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.421006Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"827a2252-6528-4257-9ca5-47d038444ff3","year":2021},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.842031Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:6294f219d41bc3fe6a5ca0bbf560898bceeb7d2bf5b4833cd7e16f3f09abac98","observation_id":"b2d7752f-b979-47ae-82c5-a04ed5ad0aa5","resolution":{"observed_at":"2026-08-07T05:18:01.426223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.402011Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"275ae3c6-fa2f-4671-b590-681ee4f1e843","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.848326Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:2db2c61787d45f7ed3a55e11872eab8144ee4ccaddec1f052fbde01bd7fd7a26","observation_id":"1a6d7fed-543b-404f-8482-084ce704ac35","resolution":{"observed_at":"2026-08-07T05:18:01.408252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.381189Z","title":"Amalgamating knowledge towards comprehensive classification","venue":null,"work_id":"d388fb26-2b66-44ac-9ee6-ca0f06822ba0","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.853219Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:2f5ac314fe083c1e6d0faac7c9334508739c871c7bc4550496d22ff65659b75b","observation_id":"e03ab5a8-29f2-4f77-9b17-149add4d7c1d","resolution":{"observed_at":"2026-08-07T05:18:01.386791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.361163Z","title":"Progressive network grafting for few-shot knowledge distillation","venue":null,"work_id":"db6ba54d-a820-4d3a-a2ad-5a502ba4d9a3","year":2021},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.858114Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:127f7d934cd1b07d314cae71caf04954ef4c53ccc847701647a694a98f81c880","observation_id":"bcf4b02e-a27e-4fe3-bbf3-f208d0d07f30","resolution":{"observed_at":"2026-08-07T05:18:01.368161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.343360Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":"d326063c-bcb4-454b-bdbb-7f0b55937652","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.864548Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:6df5f3ea90b4b20352b05367ab70ac131ac8636cd66627550c0655f801f30293","observation_id":"81077838-92b6-4cd4-bdea-5fceb44c6939","resolution":{"observed_at":"2026-08-07T05:18:01.348763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07138","snapshot_observed_at":"2026-08-07T05:18:00.869557Z","title":"Learning compact vision tokens for efficient large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.869557Z"},"links":{"cited_paper":"/paper/2506.07138","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:60f81dcd5c3225343ab5459095d0d1b8750ef4eef2fc4b4372fef5e678b872fa","observation_id":"c71ed3b0-259e-4ab7-9df1-52cbaf754290","resolution":{"observed_at":"2026-08-07T05:18:00.869557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16840","last_updated":"2024-02-26T18:59:03Z","snapshot_observed_at":"2026-08-16T14:15:11.211927Z","submitted_at":"2024-02-26T18:59:03Z","title":"MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16840","snapshot_observed_at":"2026-08-07T05:18:00.874995Z","title":"Mobillama: Towards accurate and lightweight fully transparent gpt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.874995Z"},"links":{"cited_paper":"/paper/2402.16840","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:61bd126d4af3704f7c9e2a17fa89ae2d9dd33bed31c2ab666229181f9e046cdc","observation_id":"7aa2ad72-1f46-46ef-a88e-45072a432edd","resolution":{"observed_at":"2026-08-07T05:18:00.874995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.324608Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":"d8d56705-1340-4d8b-9049-fb7e5ed354b0","year":2023},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.882942Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:100980e57afa382dfa42d0412991559a324333090bfa816e680d74145430b701","observation_id":"78e6679a-bcb9-4277-bb50-f42df4b913bc","resolution":{"observed_at":"2026-08-07T05:18:01.330822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.306775Z","title":"LaMini-LM: A diverse herd of distilled models from large- scale instructions","venue":null,"work_id":"85b66c95-dd44-4747-91c6-fb5b616a5562","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.889575Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:0745f69bc0b14551dd7cebd4b124f5b0d449d056f5f1ee0b88c773520f205cc4","observation_id":"f1264099-5f0f-4388-9fc6-83c208d9a2c3","resolution":{"observed_at":"2026-08-07T05:18:01.311997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.287506Z","title":"Sheared LLaMA: Accelerating language model pre-training via structured pruning","venue":null,"work_id":"c736abea-9f3f-4d81-b4c4-15c871639913","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.895291Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:1b1554599b23e63aa13ff96a753e1fb109d1011e6267af640fee00bc550111aa","observation_id":"2915fee0-4dd4-4b65-a4df-9352a3f62240","resolution":{"observed_at":"2026-08-07T05:18:01.294103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.267235Z","title":"Outlier weighed layerwise sparsity (owl) a missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"6740a1de-6ffe-4352-8000-50c82eb9c5d7","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.901101Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:cf6158b4080d30a378811eba8976bc513f7f08ee6fecb696a45bb7713ccce494","observation_id":"98954a94-d164-4709-b0a1-40f41b39c9ff","resolution":{"observed_at":"2026-08-07T05:18:01.272457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.247695Z","title":"Be your own teacher: Improve the performance of convolutional neural networks via self distillation","venue":null,"work_id":"8d0ae950-8b9e-4b6d-b29c-02c5f41023b1","year":2019},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.908459Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:f87ea364f7263b5acc35d255a51a4f7507db7d6effce7fb636fb93e09f4d3062","observation_id":"cea5167b-bad2-4919-98df-f348459342ec","resolution":{"observed_at":"2026-08-07T05:18:01.254986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.223879Z","title":"LoRAPrune: Structured pruning meets low-rank parameter-efficient fine-tuning","venue":null,"work_id":"28572d80-c003-4674-bb65-da3593fa287d","year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.913433Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:abc28994c7e310ce7a4671a2c2ca72660c4bd882614b29e1109bac08c0300d68","observation_id":"126ed860-7599-41b3-81ad-f350f9cc52a3","resolution":{"observed_at":"2026-08-07T05:18:01.229170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.932104Z","title":"Tinyllama: An open-source small language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.932104Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:d1902de7e4846d86d8624974c64b7ef20ce8be5331cf0938b1ba1fd7ec792b48","observation_id":"113da4f3-6025-4798-986d-88977a3da9f5","resolution":{"observed_at":"2026-08-07T05:18:00.932104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:01.179756Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":"8032e6b8-b11f-4be1-8534-ac73ff120c29","year":2022},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.945501Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:ba19b8e21fdb16cc691bc4457e280c09a7d2cc6038f3da8a500a53345dd14490","observation_id":"b06d7cf2-3449-43c7-80dc-d9f2e60b725e","resolution":{"observed_at":"2026-08-07T05:18:01.186968Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:18:00.922317Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.922317Z"},"links":{"citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:a1b99bcead0af2c88acd2ba62dc73a0889979a7cbce7c06bc2572e6b5b3e5c1f","observation_id":"597da13f-ac1f-4420-88ae-2531553071de","resolution":{"observed_at":"2026-08-07T05:18:00.922317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.11120."}