{"as_of":"2026-08-23T04:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1458a6eb4c397f748dac39de731bfdb6321728a3df9d7f7a633433a32f7c65c1","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:06:41.062180Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03510/citation-record","integrity":"/paper/2506.03510/integrity","json":"/paper/2506.03510/citation-record.json","paper":"/paper/2506.03510"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.072019Z","title":"Slicegpt: Compress large language models by deleting rows and columns","venue":null,"work_id":"cf16c1e8-784e-4c97-afd9-6af3738ece01","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.206536Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:bf0f8df1df33a8e4fbb3b6bfc863a45feb8d63738fd1d9ea86bc9a78cba47466","observation_id":"5556fa6b-2f0c-49df-abfd-fe95bc6ab418","resolution":{"observed_at":"2026-08-07T11:06:47.075297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.564223Z","title":"• ARC-Challenge and ARC-Easy[Clark et al., 2018] are datasets composed of grade-school level multiple-choice science questions","venue":null,"work_id":"065f2860-01e9-44ab-aec8-5fa3cb60d6f7","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.829414Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:66587dea68f1c5d0a092e98fb9e8b4d0ecb5c92c1d6d051f2a02097c31a9a7d3","observation_id":"aa1fee7e-3982-41fb-ad3d-30f40759b92d","resolution":{"observed_at":"2026-08-07T11:06:41.653879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.821314Z","title":"Pea-kd: Parameter-efficient and accurate knowledge distillation on bert","venue":null,"work_id":"3433d6a3-60dc-45ba-b6f5-7885c4e7c8b8","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.414283Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:4147c3220bb87177d699d091bfec788d4fab1f73576905621857435d5b27ef66","observation_id":"e01af565-2563-4ba0-ac88-66611601c497","resolution":{"observed_at":"2026-08-07T11:06:46.934334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.254468Z","title":"This demonstrates that five candidates are sufficient to find the sublayer with the least importance score","venue":null,"work_id":"f45f008f-d1d5-4987-85ff-98a6fcab9e07","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.983994Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:d9ef6f73ff8cd6df8226ee262a9946f203bd8992f59bda31c735c7c4cd7f9cdf","observation_id":"38237da4-63d0-476f-9c26-bc362fbc1804","resolution":{"observed_at":"2026-08-07T11:06:41.342946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.736502Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"77d30bad-9d56-4c65-9ddd-e47d0f6fe26c","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.893937Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:39b53347f38243fc30c935432a27d1c8f058f54249e70f87af8a69c816874762","observation_id":"662f402c-6d1d-4514-8715-854e9007b60e","resolution":{"observed_at":"2026-08-07T11:06:45.856973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.529196Z","title":"OPTQ: Accurate quantization for generative pre-trained transformers","venue":null,"work_id":"7d9d7081-7cca-4a9f-b539-0d1502d306cf","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.954853Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:1852f2b1ca71fba902a5d06b74603d8678b695fe689dba5f3adb201345418532","observation_id":"7a9db158-1b3b-4329-bf3c-fedc0359d932","resolution":{"observed_at":"2026-08-07T11:06:45.688354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.355291Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":"9a66ab98-d9d0-4974-85f7-3471f185f8d5","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.036607Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:f8a15e4f613d1ec92122fa7545a5087f2364f19ce06c0caf50c068c25b70c9f4","observation_id":"0dd00334-b931-47a4-a8d4-f03df3027c78","resolution":{"observed_at":"2026-08-07T11:06:45.418760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.171838Z","title":"A frame- work for few-shot language model evaluation, 12","venue":null,"work_id":"1cc64d75-7eb0-49e0-924e-a94a599634bb","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.140621Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:c2a6b5dc5edaf49c6f80e2bee2c24f5e6e22112ef011cf97c92adf0d8a64a2f3","observation_id":"9c5207f5-51a4-4bd3-85b5-6cedc6725560","resolution":{"observed_at":"2026-08-07T11:06:45.239781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.008141Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"5bcf427b-b441-4fa0-8b10-6f789647256f","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.218182Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:e846e810ac1d9fab11b06979ac07aef40649b8b87d63514eabda7e3c793075ab","observation_id":"22e84dfc-d61e-4113-b2c8-148e3b09b1f1","resolution":{"observed_at":"2026-08-07T11:06:45.068132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.920455Z","title":"Falcon: lightweight and accurate convo- lution based on depthwise separable convolution","venue":null,"work_id":"63129d77-2360-4de4-8d34-239f0b8f4efa","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.333525Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:dc7b1ec4d9134622c3a8df12538c17fa081a65b7d064dae8ee9310ddec9de472","observation_id":"b75d018c-4b48-4a64-b762-152809afba74","resolution":{"observed_at":"2026-08-07T11:06:44.989062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.842328Z","title":null,"venue":null,"work_id":"e7efab6a-458f-448c-a87b-a2e261efa380","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.442187Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:0405ee6344d2209581aeafad91c661d2899cc3a05ac8e05b062e17ab86ae9c17","observation_id":"90598526-0a8a-4c41-b45d-74f3b64d6507","resolution":{"observed_at":"2026-08-07T11:06:44.876957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.737612Z","title":null,"venue":null,"work_id":"0164fd1d-f1bd-4d84-b1db-b7fddd59a9aa","year":2021},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.550725Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:1077901e313b9ef7f0e56f8e0a88f2b1a7480eb98d3e39f72fc5dc6105b6205f","observation_id":"61086d0b-0683-4ab0-8507-943d620cd40c","resolution":{"observed_at":"2026-08-07T11:06:44.783332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.524732Z","title":null,"venue":null,"work_id":"942e3d12-7bbd-46ea-9715-1749a4f3d0aa","year":2021},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.743850Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:e2366608cfdea9eb219cd0f5bc2cfd08813c9bb0382a53fd8e2fb7fee82dfc5c","observation_id":"dfd76e9a-163d-41eb-9838-4cd5703574b0","resolution":{"observed_at":"2026-08-07T11:06:44.580464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.290710Z","title":"DDK: distilling domain knowledge for efficient large language models","venue":null,"work_id":"71bbc4d7-7eef-43db-9a6f-5d1600b4183e","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.951134Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:7a16ad4a0f0d47e5a601a2ac637ef28ce233f99a5edd390d1d1a2391752063e6","observation_id":"5235280a-ba91-4152-8169-b2c466d0e57f","resolution":{"observed_at":"2026-08-07T11:06:44.347291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.170297Z","title":"Llm-pruner: On the structural pruning of large lan- guage models","venue":null,"work_id":"0c7bb5fd-a9c4-4454-9da2-1535da2a19f7","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.074936Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:3947144013676aa5d0f933412e21f60899e78738404e48269bd40827459b0f91","observation_id":"5634f1d0-04b7-40a3-bf6b-b7e174af23a0","resolution":{"observed_at":"2026-08-07T11:06:44.243254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.071671Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":null,"work_id":"0b9603fc-204e-4a9c-8c25-7c427fe09165","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.230392Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:7f631b4c1c3c52c9a7fa17b009c2ac8c6e405552e46c1193a800c00c4ad06d94","observation_id":"bbaf37f5-70f7-46e7-9ad7-22660095dc21","resolution":{"observed_at":"2026-08-07T11:06:44.109191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.945352Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"883db985-2103-4551-956c-cd16e5e1c318","year":2016},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.380345Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:6814eb056a6d1417aef6f10b5d74244edd2cfc789efd4e8d40c5f5669feb80fd","observation_id":"12d06413-1a80-4661-852a-7e0e5163877e","resolution":{"observed_at":"2026-08-07T11:06:43.997597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.814336Z","title":"Sensimix: Sensitivity-aware 8-bit index & 1-bit value mixed precision quantization for bert compression","venue":null,"work_id":"72efa2d3-4db1-4b6c-94b1-f9cd80873f9e","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.571943Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:f08e061c02306cc7cbf87be1bda62f635a44f35da339b68f4f610f452f5acbff","observation_id":"0f0aae67-aac6-4589-b922-b40e8174a583","resolution":{"observed_at":"2026-08-07T11:06:43.866307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.718896Z","title":"Mixture-of-depths: Dynamically al- locating compute in transformer-based language models","venue":null,"work_id":"c281d5c8-9a69-405e-a62a-4fc635c0efcd","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.666897Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:3e2557a00ca37c4e1054282a9c13b7781fdb0d227113277880b189d58079421e","observation_id":"69e25463-b4f2-48c4-a910-89cb9613309a","resolution":{"observed_at":"2026-08-07T11:06:43.775359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.614219Z","title":"Exaone 3.0 7.8 b instruction tuned language model","venue":null,"work_id":"024ae480-1952-49ce-9612-2a82846fce81","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:39.844672Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:f381d7d29563efa24aca8287e2c87a8a416998461272861dded9b2dcfbaccc9e","observation_id":"2e88c0cc-9fc4-499e-8b3a-59aee2d02567","resolution":{"observed_at":"2026-08-07T11:06:43.642116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.476747Z","title":"Confident adaptive language modeling","venue":null,"work_id":"a26e3129-a815-4243-9085-ab6cd6abe183","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.001779Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:c822531b11ff7da8129311b29b9dae9e1cc00b84b36798ea95515ef1f605c6a3","observation_id":"8fa26fd2-3181-48d5-b2bb-ec9cf99d3a37","resolution":{"observed_at":"2026-08-07T11:06:43.540375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.324237Z","title":"Omniquant: Omnidi- rectionally calibrated quantization for large language mod- els","venue":null,"work_id":"b18720fd-5eaf-46f5-b9fe-8bf3a5e93e85","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.117420Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:6fdb4541fc2fb78829be97b8ef2e27499ec6e754297f758f5aed29f739115c41","observation_id":"010dc779-83e3-4e6f-acb5-d19675455bbf","resolution":{"observed_at":"2026-08-07T11:06:43.373199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:43.131153Z","title":"Sleb: Streamlining llms through redundancy verification and elimination of transformer blocks","venue":null,"work_id":"b6d73c6e-3283-4066-a270-bf1d55f62e41","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.178601Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:30c28df341a97c63c98b1be2eba9917fd905fe5c6d45694c74a22839824a02f3","observation_id":"4b1d685d-2559-4158-89a4-b03b97987496","resolution":{"observed_at":"2026-08-07T11:06:43.227336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.961477Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":"1fba31f7-f524-4c77-81fa-e0968f78975d","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.242222Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:6603dd2204ee8634916dffca30fcb28b2e8a776e1c100cc8521fde7d3fa7bde8","observation_id":"2140cf69-46e2-4cc5-b1dc-37371f098a7d","resolution":{"observed_at":"2026-08-07T11:06:43.038919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.808724Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":"07048956-94c8-4ff7-9f78-d7a6763b6c65","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.313820Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:b530361a38ce90a087bfd0fad3ddc51248ac5493cb0cdd87adc348b94c6359c4","observation_id":"97329a70-27f7-43d8-870c-50f274ae52ed","resolution":{"observed_at":"2026-08-07T11:06:42.890677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.679662Z","title":"Accelerating llama infer- ence by enabling intermediate layer decoding via instruc- tion tuning with lite","venue":null,"work_id":"dd9d1fd0-3f88-49b5-aa9e-a3388b088795","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.358457Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:1474f059321060e8e5be2bf3a3be8811f339faa07fd7cc96ff4f0013b2e0e559","observation_id":"472f7a99-b653-4b6b-bb98-fe8f39d00ee4","resolution":{"observed_at":"2026-08-07T11:06:42.736879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.565578Z","title":"Attention is all you need","venue":null,"work_id":"22c313f4-97c4-49f2-a7c6-44e95082eab3","year":2017},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.415973Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:ea8eca662df43494b7f86dac6f8dc9e62ceb6d5b4e5de4c42ee19762fad9d6c8","observation_id":"b6ec1720-b2c9-45df-8ca1-06f156af4020","resolution":{"observed_at":"2026-08-07T11:06:42.606699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.309072Z","title":"Outlier weighed layerwise sparsity (OWL): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"d4a185f6-ed51-4e61-98b1-66cefbe46c04","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.533464Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:74b688991ad2c834de4248ca83d5d812ee189dd30096ff51991cea80db1f689e","observation_id":"09eba7dd-b119-43f7-a49d-34a9e96886ab","resolution":{"observed_at":"2026-08-07T11:06:42.367414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.181361Z","title":"Knowledge extraction with no observable data","venue":null,"work_id":"c3240856-ff1f-4030-91d5-4674a82a968a","year":2019},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.597396Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:4b14694503c93df11e534697ca7bc53ab05629f3721ed24ff9f7b526828b2a36","observation_id":"10c44411-5b20-437a-9bd8-69aab4373dad","resolution":{"observed_at":"2026-08-07T11:06:42.232594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.039903Z","title":"Hellaswag: Can a ma- chine really finish your sentence? arXiv,","venue":null,"work_id":"62aedd0b-312b-4b06-8bad-5f085771a788","year":2019},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.672976Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:7a184bed7fa65c8d4b9554a4168e7fdffee8f2443d0b98583b26de2fdb388d58","observation_id":"b9686ceb-7242-4416-a864-7bc9aead71ef","resolution":{"observed_at":"2026-08-07T11:06:42.083604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.893713Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":"8a1502c5-cf40-4363-b5a1-1a73c91a4067","year":2022},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.737335Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:a6aa8c31c830e24feb18cb8b99981f1b69913b8a170912b70f6617766621b973","observation_id":"e09bf8af-4cc2-4796-a241-0ad8ba18e944","resolution":{"observed_at":"2026-08-07T11:06:41.951101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.722086Z","title":"Blockpruner: Fine- grained pruning for large language models","venue":null,"work_id":"682742f9-9bb2-4a27-a953-94c355e6fe2c","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.777241Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:9baf47e7abf60c8c1c8f41344a88c408f05cd1eacf2050228e0ad744af052103","observation_id":"e680e9dd-125f-4e8c-99b4-24799b1a1e9d","resolution":{"observed_at":"2026-08-07T11:06:41.819965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.148686Z","title":"LLM-Pruner cannot prune Llama-2 70B and Llama-3 8B, 70B since it does not support group query attention","venue":null,"work_id":"4c1f7af7-9ef6-471b-915f-836a89d3998f","year":null},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:41.062180Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:c3990a55a95553c80730764d07d5c636166e72d3a41970b57c8f990cafa4d436","observation_id":"a6c6d7c0-a273-46d9-9568-efd467e9c860","resolution":{"observed_at":"2026-08-07T11:06:41.205996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:41.400815Z","title":"We use a single GPU to evaluate Llama-2 7B, 13B and Llama-3 8B","venue":null,"work_id":"3997c8e5-a473-4d6e-8cf8-135a9af4f488","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.892994Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:b737ced27f5ccee08193deeb3d6c8357477c8315b32352fd19010cc236ce0538","observation_id":"34f0ca9a-7111-4823-8ce8-3ce34f438b41","resolution":{"observed_at":"2026-08-07T11:06:41.502576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:42.422431Z","title":"Qa-lora: Quantization-aware low-rank adaptation of large language models","venue":null,"work_id":"c4bf8e42-eb83-4c95-a1ca-b05869fccaf7","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:40.478109Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:4d539639c734061ba7d9e675806f8d38a70463d14caa941d74e8aa5cae43684a","observation_id":"a8a4870c-8c8c-4888-b5eb-97a159a6e20b","resolution":{"observed_at":"2026-08-07T11:06:42.486150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.183649Z","title":"Boolq: Exploring the surprising diffi- culty of natural yes/no questions","venue":null,"work_id":"86987a17-7dfa-4d49-8405-6585f4006973","year":2019},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.701919Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:da2f9a0816067edec41e2bef717db352d52d0df2e6526714284aa0c5ef75659a","observation_id":"6208b8cd-86ff-4936-a3f7-bf9d8d13b290","resolution":{"observed_at":"2026-08-07T11:06:46.351963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.993295Z","title":"The llama 3 herd of models","venue":null,"work_id":"c8e5a7e2-3ac5-4c85-ab7b-d99d266d8793","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.810918Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:a11f167712ec09437ee5eb493333bf58276144788933e719db41e4ce96b4fb8e","observation_id":"c3660369-e8ee-4ff8-ba96-58a416a8c0a0","resolution":{"observed_at":"2026-08-07T11:06:46.034194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.036135Z","title":"Language models are few-shot learners","venue":null,"work_id":"46d2aaeb-90dd-49e4-9f3c-6e96a8700eba","year":2020},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.324634Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:b1156587473f41804ee8b6aeee109244864b789b4b26619384d17371587692ae","observation_id":"262e6f9e-725a-4f8c-b8cd-7eca616d768b","resolution":{"observed_at":"2026-08-07T11:06:47.056001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.415176Z","title":"Flexround: Learnable rounding based on element-wise division for post-training quantiza- tion","venue":null,"work_id":"3ebd684e-5841-41aa-8afc-43fddae9deaa","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.853165Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:8665a662e87a0039b222aab8097520adaee7fcd02d6de33cea4d53542949ea4d","observation_id":"76a1307c-49d8-4f7d-bccd-a6c255ac0ab9","resolution":{"observed_at":"2026-08-07T11:06:44.456308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.598034Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"c8cc1b9a-1e71-4e0a-ab74-12c005751dcb","year":2023},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.510415Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:5e72e62f9c6f2e8f699928b9858a3d123163246702c5ee3167c3b3d2e12be907","observation_id":"75c45ef0-2e10-403a-b356-6c4eade2493a","resolution":{"observed_at":"2026-08-07T11:06:46.717315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.419207Z","title":"Think you have solved question answer- ing? try arc, the ai2 reasoning challenge","venue":null,"work_id":"ec7ca069-365f-4cee-9568-b1fec94d3a97","year":2018},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.633240Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:637ce173319dbaaed891d2c51704cc272467cdca1a1d455454b2811802ec8834","observation_id":"ee1a10d3-c294-4b29-834f-e99a59aef860","resolution":{"observed_at":"2026-08-07T11:06:46.487145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.063000Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"3cb11abd-c0e3-47eb-86bf-86d133bdfd01","year":2020},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:37.233404Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:aefc4f57602c6b7962c733e86fbd9f09bb0891673b63edca02243d44a6250ab2","observation_id":"08a4932e-0ad1-4204-ae89-03e97ba2dec3","resolution":{"observed_at":"2026-08-07T11:06:47.066226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:44.622837Z","title":"Distillm: Towards streamlined distil- lation for large language models","venue":null,"work_id":"d2185f3b-b5af-4882-8ba0-d8ba8d22b9df","year":2024},"citing_paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:38.628367Z"},"links":{"citing_paper":"/paper/2506.03510"},"observation_digest":"sha256:c1e11fcabc08265be32d9882ccdb37638c09406e016f189ec674dce6d835936d","observation_id":"83424917-ff2e-41e3-bc0e-ba0caa9b00ec","resolution":{"observed_at":"2026-08-07T11:06:44.670504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03510","last_updated":"2025-06-04T02:53:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:58:52.741157Z","submitted_at":"2025-06-04T02:53:34Z","title":"Accurate Sublayer Pruning for Large Language Models by Exploiting Latency and Tunability Information"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.03510."}