{"as_of":"2026-08-09T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8c4e18d762728b8222e4cf6e206b7d4644155f30a44f0711e4701387a52a71a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:48:53.872551Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:57:41.273776Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.173800Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-08-07T05:57:41.273776Z","title":"Efficientllm: Scalable pruning-aware pretraining for architecture-efficient large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11105","last_updated":"2025-08-07T14:57:45Z","snapshot_observed_at":"2026-08-07T05:50:57.667003Z","submitted_at":"2025-06-07T01:37:42Z","title":"Enabling On-Device Medical AI Assistants via Input-Driven Saliency Adaptation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:57:41.273776Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2506.11105"},"observation_digest":"sha256:2bab39a7975633ed0cf20743c6a55cf3a06f0d5c01fab112cc331b189e40d4ed","observation_id":"ccdee7e0-425a-4450-bed7-d00ea8d62d8b","resolution":{"observed_at":"2026-08-07T05:57:41.273776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-08-06T23:51:05.522354Z","title":"Efficientllm: Scalable pruning-aware pretraining for architecture-agnostic edge language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16054","last_updated":"2025-06-19T06:25:02Z","snapshot_observed_at":"2026-08-07T13:41:59.610268Z","submitted_at":"2025-06-19T06:25:02Z","title":"PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.522354Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2506.16054"},"observation_digest":"sha256:fbdc7b0ac87f7116b58cf5c58e22f699f5541ad195c3f3815ede9ffceb39ca7a","observation_id":"fe5c8862-117c-40f9-a117-ba5ddff78986","resolution":{"observed_at":"2026-08-06T23:51:05.522354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-08-06T15:06:48.293267Z","title":"Efficientllm: Scalable pruning-aware pretraining for architecture-agnostic edge language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16731","last_updated":"2025-07-22T16:13:43Z","snapshot_observed_at":"2026-08-07T22:15:08.576638Z","submitted_at":"2025-07-22T16:13:43Z","title":"Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-06T15:06:48.293267Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2507.16731"},"observation_digest":"sha256:0828058230b4cef83cf437f2957c8e968951c0247822818033a573cdf312b740","observation_id":"e24c69d8-d99b-4368-9e81-201e45a515d0","resolution":{"observed_at":"2026-08-06T15:06:48.293267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-08-05T21:08:18.721011Z","title":"Efficientllm: Scalable pruning-aware pretraining for architecture-agnostic edge language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09471","last_updated":"2025-08-13T04:00:56Z","snapshot_observed_at":"2026-08-09T15:34:29.981759Z","submitted_at":"2025-08-13T04:00:56Z","title":"EGGS-PTP: An Expander-Graph Guided Structured Post-training Pruning Method for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:08:18.721011Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2508.09471"},"observation_digest":"sha256:dc34c6f90f2146cbf363e379aa540efe89085bbe68b175543e7dd11ac7037198","observation_id":"37eedbe6-45ce-4eac-81ba-75c2ae95c56e","resolution":{"observed_at":"2026-08-05T21:08:18.721011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":"2502.06663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-07-04T16:39:58.173800Z","title":"Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, and Yoon Kim","venue":null,"work_id":"912d1f05-b0c3-4f83-837d-6b0f8e641dc6","year":2025},"citing_paper":{"arxiv_id":"2510.04595","last_updated":"2026-04-12T08:00:47Z","snapshot_observed_at":"2026-08-09T07:38:29.823568Z","submitted_at":"2025-10-06T08:49:04Z","title":"SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T09:44:53.290259Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2510.04595"},"observation_digest":"sha256:ab15d03630d5ce8436d39594887d1adb1ff0f4453eb05b0d37daa60e02de9e1e","observation_id":"e73a38b8-909a-41d9-ab6f-06ffc7f20578","resolution":{"observed_at":"2026-05-18T09:46:12.425193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":"2502.06663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-07-04T16:39:58.173800Z","title":"Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, and Yoon Kim","venue":null,"work_id":"912d1f05-b0c3-4f83-837d-6b0f8e641dc6","year":2025},"citing_paper":{"arxiv_id":"2606.12895","last_updated":"2026-06-11T04:54:07Z","snapshot_observed_at":"2026-08-05T13:05:21.202083Z","submitted_at":"2026-06-11T04:54:07Z","title":"LongSpike: Fractional Order Spiking State Space Models for Efficient Long Sequence Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T07:26:58.608421Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2606.12895"},"observation_digest":"sha256:ecfed994776b050141cc23fd56f99a40adeb9e98092492f3f573cee25cbe7ad0","observation_id":"ad8f0973-8cfa-46fa-ac74-2c6116ae904b","resolution":{"observed_at":"2026-07-03T13:48:21.554743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"cited_work":{"arxiv_id":"2502.06663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06663","snapshot_observed_at":"2026-07-04T16:39:58.173800Z","title":"Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, and Yoon Kim","venue":null,"work_id":"912d1f05-b0c3-4f83-837d-6b0f8e641dc6","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2502.06663","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:5bc590aab1f52186c02a44c53cd09cd32a7c6b59e5cb2a9bf5ada93fae7a5deb","observation_id":"b141b3e0-d1e4-420d-a508-b1237e209ec6","resolution":{"observed_at":"2026-07-04T16:39:58.175300Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06663/citation-record","integrity":"/paper/2502.06663/integrity","json":"/paper/2502.06663/citation-record.json","paper":"/paper/2502.06663"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T14:48:53.713646Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.713646Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:b0fc88b8e5b84248799c1030ed60bd0881cfb1b9e10841acb54a33884c8335ab","observation_id":"8f3ab860-3862-425a-b051-c27b1b780814","resolution":{"observed_at":"2026-08-08T14:48:53.713646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.298488Z","title":null,"venue":null,"work_id":"ddd74819-8994-403f-83fb-4099ef6b7b33","year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.854946Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:c140723a6ed4562ae7ab7d143d0076084720178b089a44b7240f39e80c71db81","observation_id":"798e0fec-30ae-4efe-b2e4-00e3b0bada86","resolution":{"observed_at":"2026-08-08T14:48:54.302037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09791","last_updated":"2020-04-29T20:49:05Z","snapshot_observed_at":"2026-07-06T08:16:55.767797Z","submitted_at":"2019-08-26T16:46:23Z","title":"Once-for-All: Train One Network and Specialize it for Efficient Deployment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09791","snapshot_observed_at":"2026-08-08T14:48:53.736258Z","title":"Once- for-all: Train one network and specialize it for efficient deployment","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.736258Z"},"links":{"cited_paper":"/paper/1908.09791","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:2078a32a6cfdbddd924e20e825b908aadd6cf65b01007c0657a3caaef2dfbc61","observation_id":"6eacaf97-e309-42b5-96b8-72f4521e9fc6","resolution":{"observed_at":"2026-08-08T14:48:53.736258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.250432Z","title":null,"venue":null,"work_id":"3aa3b38a-ee58-4093-96b9-23822c604d6d","year":2024},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.869090Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:0461c5f080ac2d393de32c63fc5831bd9df679b1dabae8d54087803e37f5c6eb","observation_id":"1ae18473-803c-4e45-a69f-3f33a544c34e","resolution":{"observed_at":"2026-08-08T14:48:54.254028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.321591Z","title":null,"venue":null,"work_id":"659275db-b409-4fb7-9a8c-e472bd153ad2","year":2018},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.745087Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:480ce0f209ad32bb77aa8eb94a343a5831501717757e81fa9da57626094e6c08","observation_id":"4cfeaa97-fc74-46f0-8658-45dc07c9b08f","resolution":{"observed_at":"2026-08-08T14:48:54.325593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T14:48:53.752765Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.752765Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:4411a71b91ded7f18bfa777f93629d9999fddcaef019f57f090c925dbeafe025","observation_id":"894b5e95-d578-428f-98b6-91591743197c","resolution":{"observed_at":"2026-08-08T14:48:53.752765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02924","last_updated":"2024-06-05T04:25:23Z","snapshot_observed_at":"2026-08-09T09:34:57.546210Z","submitted_at":"2024-06-05T04:25:23Z","title":"Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02924","snapshot_observed_at":"2026-08-08T14:48:53.757177Z","title":"Pruner-zero: Evolving symbolic pruning metric from scratch for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.757177Z"},"links":{"cited_paper":"/paper/2406.02924","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:7b62d613cbe3482cc7a9ad46ecde0676acd794e9f19873328dc7b61422645466","observation_id":"190f5ca2-4292-4134-be93-cc6086e7ec93","resolution":{"observed_at":"2026-08-08T14:48:53.757177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:48:53.761083Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.761083Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:c0f13d9a944e8fff967cc3f6e52917a2ce642cc65ea4780fc010c501bc5229ce","observation_id":"a9b68355-29d5-4fc4-950c-ae16daa6f3f1","resolution":{"observed_at":"2026-08-08T14:48:53.761083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-08T14:48:53.764890Z","title":"Groeneveld, D., Beltagy, I., Walsh, P., Bhagia, A., Kinney, R., Tafjord, O., Jha, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.764890Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:44ee74cc48c99e08284049ec59d1c003abac87f1676d11732e1a95e48cfdb0f8","observation_id":"34a1062a-1c98-4e6b-add1-0222eca57003","resolution":{"observed_at":"2026-08-08T14:48:53.764890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T14:48:53.768926Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.768926Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:262bea250e24088d2278341de06eb81f0d3389928d3f7223565442e1b825d4b9","observation_id":"ece9b58d-50be-440a-b617-d68de8f4da27","resolution":{"observed_at":"2026-08-08T14:48:53.768926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-08T14:48:53.780997Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.780997Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:1d9046bfcb83aff8a2f8b4b12a2da187995ca4515cf46a3c332b98d13afd8950","observation_id":"ecda896b-6e75-443b-8092-fc93d81d32bc","resolution":{"observed_at":"2026-08-08T14:48:53.780997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T14:48:53.784871Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.784871Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:f1d476eaa3cb796e9dcb2aacf4748cbc83c59dcb50b44f0e3f831d0b40826f71","observation_id":"fe5e4031-22cd-457a-a7e5-9ab88f5c360a","resolution":{"observed_at":"2026-08-08T14:48:53.784871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-05T01:48:55.895470Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-08T14:48:53.789335Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.789335Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:b36ea47cc556436df4caadcf7b70cc65a7af78d45521af31b5188802087a2212","observation_id":"bab0a534-e073-49c7-ad5c-4fdaa397ab83","resolution":{"observed_at":"2026-08-08T14:48:53.789335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-08T14:48:53.792864Z","title":"org/abs/2406.11794","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.792864Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:8d9b8fa2c7630a74ef244177ec93f0d50fe71c3bc09b0473914fc0faefdca553","observation_id":"f487d1e6-c35c-409e-938a-f6a0537a3302","resolution":{"observed_at":"2026-08-08T14:48:53.792864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.09055","last_updated":"2019-04-23T06:29:32Z","snapshot_observed_at":"2026-08-09T13:23:20.015254Z","submitted_at":"2018-06-24T00:06:13Z","title":"DARTS: Differentiable Architecture Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.09055","snapshot_observed_at":"2026-08-08T14:48:53.796680Z","title":"Darts: Differentiable architecture search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.796680Z"},"links":{"cited_paper":"/paper/1806.09055","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:4fab685d3061dc377e46993ed9d953af4cccb5ac5596dae74f82784ee12d92c8","observation_id":"f642e492-42a3-44e6-90c7-b93ca0ed93f5","resolution":{"observed_at":"2026-08-08T14:48:53.796680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-07T05:13:11.135540Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-08T14:48:53.800690Z","title":"Mobilellm: Optimizing sub-billion parameter lan- guage models for on-device use cases","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.800690Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:232e32afd197a3d56a14d84f90a0450abcb32989d0013085bfa2a42d6d649c37","observation_id":"b4e02bb4-9866-440f-9ff9-1f30885a9f7d","resolution":{"observed_at":"2026-08-08T14:48:53.800690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11057","last_updated":"2024-09-17T10:35:30Z","snapshot_observed_at":"2026-07-06T19:16:36.688367Z","submitted_at":"2024-09-17T10:35:30Z","title":"KVPruner: Structural Pruning for Faster and Memory-Efficient Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11057","snapshot_observed_at":"2026-08-08T14:48:53.804404Z","title":"Lv, B., Zhou, Q., Ding, X., Wang, Y ., and Ma, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.804404Z"},"links":{"cited_paper":"/paper/2409.11057","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:a05d24efb47561a05f40263fe38c538d5f9eb222524b0def60d7f1e8a1d2accb","observation_id":"8a3a09ec-7afe-49f6-b34f-d893f9a8f504","resolution":{"observed_at":"2026-08-08T14:48:53.804404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-08T14:48:53.807846Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.807846Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:b08b94a9273e14d60bb39d7c4c52308bd96a4d087e5737e22f59be5a93daf957","observation_id":"e8d8470a-9652-44c4-8e86-59b7f1957ee7","resolution":{"observed_at":"2026-08-08T14:48:53.807846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-08T14:48:53.815448Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.815448Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:a8cbfda0cbe04e8ae692cf9ddde7b34af82bbc9f36ba422810300e9bed1356a9","observation_id":"529cbc2c-0263-490d-93fe-2dfcf4ae0751","resolution":{"observed_at":"2026-08-08T14:48:53.815448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02791","last_updated":"2025-04-03T02:13:53Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T07:59:38Z","title":"PanGu-$\\pi$ Pro:Rethinking Optimization and Architecture for Tiny Language Models","version":4},"cited_work":{"arxiv_id":"2402.02791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02791","snapshot_observed_at":"2026-08-08T14:48:53.977667Z","title":"PanGu-$\\pi$ Pro:Rethinking Optimization and Architecture for Tiny Language Models","venue":"cs.CL","work_id":"4768d57d-eba1-41fd-97c1-d8ab6aa4b785","year":2024},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.819732Z"},"links":{"cited_paper":"/paper/2402.02791","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:d9036c03c65d92cf22c508477f96c9393338d98d216237f8dd63810f0c596dc6","observation_id":"0c547a0a-7c88-4789-8cc9-243b8221fb93","resolution":{"observed_at":"2026-08-08T14:48:53.984095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T14:48:53.823338Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.823338Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:46305f82e9c6c9c6c29ab9ea7c8982e3304c80df32a7c6c64b3bea4492f72ae1","observation_id":"fdeed727-1187-4614-b9eb-63ea10f9b19e","resolution":{"observed_at":"2026-08-08T14:48:53.823338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-08T14:48:53.827249Z","title":"Redpajama: an open dataset for training large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.827249Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:4d655f77f3f76d14bbb72090f56ca98571228856098e45cf7cb56e0f8a9a75ff","observation_id":"e48a6e5c-c83a-4769-a84a-670bd1d3bd6b","resolution":{"observed_at":"2026-08-08T14:48:53.827249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-08T14:48:53.831312Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.831312Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:2ad968c6be2a4e3dc65749cd71f6120fcf66d4e08b16a7401de247115a7cfb73","observation_id":"a5aba48e-cbcd-41a1-b271-16fb0f188a4e","resolution":{"observed_at":"2026-08-08T14:48:53.831312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.309354Z","title":"Nas-bert: Task-agnostic and adaptive-size bert com- pression with neural architecture search","venue":null,"work_id":"6eb90ba4-c09f-43c0-8460-7bc7b0d0c248","year":1933},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.835395Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:4a6fc3d67583e6d66b6f58778ec68a6ad8ecb7c6e88c34b7668594cdcdd062df","observation_id":"ef81d76d-59cd-4edf-84ca-4660fd1f7634","resolution":{"observed_at":"2026-08-08T14:48:54.313868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T14:48:53.839396Z","title":"Qwen2 techni- cal report, 2024a","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.839396Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:1ec473dd4fe720b8d7c10e4b208a5a4559c1ace9f34c0858902b31a43d423a3e","observation_id":"72a9d564-1cbc-4249-bedd-9290e6313f56","resolution":{"observed_at":"2026-08-08T14:48:53.839396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-08T14:48:53.843460Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.843460Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:5586057666ba74a77ee22e990cc423858972cba5f22026d4124262b7f5786293","observation_id":"f2f6e10b-e5fa-4e2e-ae13-efc03a6cb1a6","resolution":{"observed_at":"2026-08-08T14:48:53.843460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18403","last_updated":"2024-08-07T03:30:30Z","snapshot_observed_at":"2026-08-09T12:33:50.387527Z","submitted_at":"2023-05-28T15:15:48Z","title":"LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18403","snapshot_observed_at":"2026-08-08T14:48:53.847426Z","title":"Loraprune: Pruning meets low- rank parameter-efficient fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.847426Z"},"links":{"cited_paper":"/paper/2305.18403","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:b04e34636077bb5c789f588b4ebe99fe136fd1782ed14f84f9b6a5a35aab04da","observation_id":"a58e704a-733f-433e-a9ef-3ad4aa58dc74","resolution":{"observed_at":"2026-08-08T14:48:53.847426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-08T14:48:53.851478Z","title":"org/abs/2205.01068, 3:19–0, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.851478Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:9f863bce2c36597650e0981e2188c90906c164e4067f815191f70b1c1b7c6a1a","observation_id":"f6ad8578-5174-4626-a153-99844b7d91e6","resolution":{"observed_at":"2026-08-08T14:48:53.851478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.274532Z","title":"The OBD only uses the second-order term in Eq.9, which applied the diagonal of the Hessian matrix for approximate calculation","venue":null,"work_id":"bcdadfe2-2fec-4934-86fe-5c18a847f39b","year":1989},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.861524Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:001d7766a91f449a5ec2a43e0baa1107994ddba34af89becd87857d4032250f0","observation_id":"59a97f15-5739-43e6-a926-b375282da3d0","resolution":{"observed_at":"2026-08-08T14:48:54.278528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.261200Z","title":"In the case of GQA, cluster attention can be obtained through pruning","venue":null,"work_id":"360c1094-eb54-42d1-bb98-3801dbb468d6","year":2023},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.865131Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:caaf1266fa7ce8d38a6ae76c5a4a1cef9331295909198d20ae15d259163e27bb","observation_id":"14fa2ed5-5772-49d4-9467-e63cb8ce02b0","resolution":{"observed_at":"2026-08-08T14:48:54.266579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.238836Z","title":"• Common Sense Reasoning: Follow most of recent works (Xia et al., 2023; Ma et al., 2023; Li et al., 2024), we apply the widely used lm-evaluation-harness package (Gao et al.,","venue":null,"work_id":"a38b2037-cf80-4bbe-b613-b72386182cef","year":2023},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.872551Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:9776edf7448953b6fb6d130ab7fda98e25a43d44118feb9f8ced2040bf4a799e","observation_id":"020bf5b9-ccaa-4e71-81a8-f8c185639cdd","resolution":{"observed_at":"2026-08-08T14:48:54.243326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:54.286054Z","title":"In EfficientLLM, the pruning ratio of 13 EfficientLLM hidden-size is smaller than attention heads and FFN intermediate channels driven by saliency","venue":null,"work_id":"650fcbc0-23a6-4ea0-8c92-989abb642322","year":1963},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.858277Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:68cde8af2a5a14649717cea8963561a1207aa6798b148aa3bead6fad3d13ca4b","observation_id":"656c0315-c6e3-49f5-99ca-e62948459046","resolution":{"observed_at":"2026-08-08T14:48:54.290343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T14:48:53.776783Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.776783Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:dbfc395df0a5f8433ba23fe3d6c398f5f6c3c17a90af401249e997eb04be1385","observation_id":"9124714c-a921-4b6e-989f-2aab1e64f92e","resolution":{"observed_at":"2026-08-08T14:48:53.776783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-08T14:48:53.748682Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.748682Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:67a7364540d1385f5c583525d2527419a8d6628bbe5a6e5da61770f62739b11c","observation_id":"cecafcd9-8a91-4ee3-a45d-bd68ef53d76c","resolution":{"observed_at":"2026-08-08T14:48:53.748682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18356","last_updated":"2023-10-31T04:21:33Z","snapshot_observed_at":"2026-07-06T16:39:40.673808Z","submitted_at":"2023-10-24T00:47:26Z","title":"LoRAShear: Efficient Large Language Model Structured Pruning and Knowledge Recovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18356","snapshot_observed_at":"2026-08-08T14:48:53.740780Z","title":"Lorashear: Efficient large language model struc- tured pruning and knowledge recovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.740780Z"},"links":{"cited_paper":"/paper/2310.18356","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:cd2aa7815669ecb46ef1bce601869526a14506522880d1069beb32084164ec4e","observation_id":"6e0ee9c7-a947-4b34-864f-107dcb7c7a2c","resolution":{"observed_at":"2026-08-08T14:48:53.740780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-08T14:48:53.727799Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.727799Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:5ea6141eec2f3894309829d69b44ad1662d9afb80a0551e1fdbdfaf113a51d9a","observation_id":"7287ffb9-d81b-4697-98f5-767a630b1420","resolution":{"observed_at":"2026-08-08T14:48:53.727799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11796","last_updated":"2024-12-09T18:31:01Z","snapshot_observed_at":"2026-08-07T10:56:20.468878Z","submitted_at":"2024-08-21T17:38:48Z","title":"LLM Pruning and Distillation in Practice: The Minitron Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11796","snapshot_observed_at":"2026-08-08T14:48:53.811446Z","title":"T., Muralidharan, S., Joshi, R., Chochowski, M., Patwary, M., Shoeybi, M., Catanzaro, B., Kautz, J., and Molchanov, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.811446Z"},"links":{"cited_paper":"/paper/2408.11796","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:7d1f83a1c73555685301b87e246987944ae8d9ff99a6939ecce83687621f6988","observation_id":"313ce8fb-7d42-4e94-b702-473a0da0fd46","resolution":{"observed_at":"2026-08-08T14:48:53.811446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:48:53.731978Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.731978Z"},"links":{"citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:0f6e44fa9a0e1004b98ebdfffa88e898b61d6f837fe3c4d78cb705949d894aa3","observation_id":"8e7ef76d-b74f-4dce-a9a0-03e4a6acc423","resolution":{"observed_at":"2026-08-08T14:48:53.731978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-08T14:48:53.718637Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.718637Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:35965b771f6d1023789ab621aef246cb690dedc4431447ac7d7bfa496b88b2e0","observation_id":"e755fc7b-d8bf-40da-8d09-6ad0a50c03e8","resolution":{"observed_at":"2026-08-08T14:48:53.718637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-07-06T17:21:01.918787Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-08T14:48:53.723438Z","title":"L., Nascimento, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.723438Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:848508a0ac5e5d8f2e0e61ff58d6aa6a23fe169210548a007b2e52e27ea15ada","observation_id":"4398016a-ddfb-455e-8aa3-4384cb73cd52","resolution":{"observed_at":"2026-08-08T14:48:53.723438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-08T14:48:53.772787Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T14:48:53.772787Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2502.06663"},"observation_digest":"sha256:8c2f389a4310f8c6b9356c09102a3a507ff92c94f5b32371b3d6877b2b6052c6","observation_id":"b3876975-b4dc-4fce-8d8a-cbd91ebb2a7e","resolution":{"observed_at":"2026-08-08T14:48:53.772787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06663","last_updated":"2025-02-11T19:01:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T14:42:01.589221Z","submitted_at":"2025-02-10T16:51:03Z","title":"EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2502.06663."}