{"as_of":"2026-08-14T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:798610bfdb46fb3942d2c19575ae8944c7a18d81cc800ff4e3886283c214f7e4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:53:54.748614Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:08:50.012079Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:e11912e3012518ca2f9e6f22ecba9a04f476ff062aed0a89c755c509d61725b8","observation_id":"be36b2e7-608d-4942-b512-7d9e33db634f","resolution":{"observed_at":"2026-05-15T02:39:33.169470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2411.08982","last_updated":"2026-05-18T20:44:06Z","snapshot_observed_at":"2026-07-06T19:50:01.724540Z","submitted_at":"2024-11-13T19:18:08Z","title":"Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T17:04:13.905401Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2411.08982"},"observation_digest":"sha256:42ffe0b4cf273464202033fcfd5e7487df1da40f321a0e23df8c46fef9edb884","observation_id":"3cce7e1d-3d45-4a35-92ce-7874c9a6a402","resolution":{"observed_at":"2026-05-23T17:05:42.981077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:e36c6b4707408671d06f4021a34127474c7f3198fcb73e9b5c45c5b035ce7c42","observation_id":"04cc05ad-d4f1-40d2-a50f-9be1250037d4","resolution":{"observed_at":"2026-05-23T17:13:14.061601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-11T12:44:35.784417Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14219","last_updated":"2025-01-22T03:33:25Z","snapshot_observed_at":"2026-08-13T23:36:29.207493Z","submitted_at":"2024-12-18T14:11:15Z","title":"A Survey on Inference Optimization Techniques for Mixture of Experts Models","version":2},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-11T12:44:35.784417Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2412.14219"},"observation_digest":"sha256:22a86d3931dc22fdc4802a7f38a36aad82af5b0877521994fa31e30ccd570b21","observation_id":"be861a79-27c5-4833-b505-0ca987992fb0","resolution":{"observed_at":"2026-08-11T12:44:35.784417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-11T12:03:42.933715Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14711","last_updated":"2025-02-27T16:33:09Z","snapshot_observed_at":"2026-08-11T20:31:43.301384Z","submitted_at":"2024-12-19T10:21:20Z","title":"ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:03:42.933715Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2412.14711"},"observation_digest":"sha256:bcd44664ba6acbdffa60de9a25bad89dcb9621bfa186b27fd33d92711b103e89","observation_id":"18b9bd51-1a3c-4b17-8def-39ac652d051d","resolution":{"observed_at":"2026-08-11T12:03:42.933715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-10T21:49:19.102680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03905","last_updated":"2025-09-04T08:37:22Z","snapshot_observed_at":"2026-08-13T04:11:16.474532Z","submitted_at":"2025-01-07T16:19:40Z","title":"MixNet: A Runtime Reconfigurable Optical-Electrical Fabric for Distributed Mixture-of-Experts Training","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T21:49:19.102680Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2501.03905"},"observation_digest":"sha256:bb4f7d951953ca25ab2ef443d4364ba3b30016737551871694c1e2631a61baa5","observation_id":"7c5fdd40-eae3-4dce-9bf1-da10091dabad","resolution":{"observed_at":"2026-08-10T21:49:19.102680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-11T14:53:54.748614Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10375","last_updated":"2025-05-04T09:49:42Z","snapshot_observed_at":"2026-08-14T10:59:29.106479Z","submitted_at":"2024-12-16T07:59:21Z","title":"DAOP: Data-Aware Offloading and Predictive Pre-Calculation for Efficient MoE Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:53:54.748614Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2501.10375"},"observation_digest":"sha256:2b7f93566fb07024ea659f7cbdd33b270469dd765a1d83f593fa9f1af1a2cc5f","observation_id":"b3dba00c-5bcb-4b78-bc43-ea49ad7fb54d","resolution":{"observed_at":"2026-08-11T14:53:54.748614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2502.04416","last_updated":"2026-04-23T00:51:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-06T14:05:30Z","title":"Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T04:08:29.089438Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2502.04416"},"observation_digest":"sha256:c2328880c0f3e9fc6afc1e922b1219194dcb76c9f850e788262fb70a4c60d766","observation_id":"1e936820-78cb-4947-8138-fb9c67f9fa18","resolution":{"observed_at":"2026-05-23T04:12:31.024128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-07T12:24:26.135538Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24597","last_updated":"2025-05-30T13:45:19Z","snapshot_observed_at":"2026-08-07T23:31:01.218741Z","submitted_at":"2025-05-30T13:45:19Z","title":"Mixture-of-Experts for Personalized and Semantic-Aware Next Location Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:24:26.135538Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2505.24597"},"observation_digest":"sha256:74d64f88f75f6d6c46b4b9194326ffa359f6767d9a29155be5208d230d2434e6","observation_id":"67490233-5793-44a9-b3c2-f78e74f865f3","resolution":{"observed_at":"2026-08-07T12:24:26.135538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-05T11:30:13.500526Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02753","last_updated":"2025-09-02T19:01:46Z","snapshot_observed_at":"2026-08-13T14:40:32.193986Z","submitted_at":"2025-09-02T19:01:46Z","title":"LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T11:30:13.500526Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.02753"},"observation_digest":"sha256:a4cd8325208e6536f1f02c4ff00acd7d0ce8569bbc5207d8c8a65239a8153d53","observation_id":"c4a8d045-f5ad-4705-bb1d-3a339f719c1c","resolution":{"observed_at":"2026-08-05T11:30:13.500526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-04T21:51:05.721834Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07727","last_updated":"2025-09-09T13:28:41Z","snapshot_observed_at":"2026-08-09T18:16:28.980674Z","submitted_at":"2025-09-09T13:28:41Z","title":"MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T21:51:05.721834Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.07727"},"observation_digest":"sha256:3750a92cf64c146727859762b1d318d8602ba34b4b643170e73b4747ab0777f2","observation_id":"822ff542-9253-4c11-9d77-6273aba3864c","resolution":{"observed_at":"2026-08-04T21:51:05.721834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-04T19:27:19.418335Z","title":"Ma, J.; Li, F.; and Wang, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09267","last_updated":"2025-09-11T08:53:37Z","snapshot_observed_at":"2026-08-11T22:31:24.238363Z","submitted_at":"2025-09-11T08:53:37Z","title":"Unified Start, Personalized End: Progressive Pruning for Efficient 3D Medical Image Segmentation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:19.418335Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.09267"},"observation_digest":"sha256:4114ba95dbd54e8c83f7479eb9e3b9167a9a1fe4330d321a298f4dc70253ce44","observation_id":"e503e305-eb19-4b77-b620-c66d5a4e5d81","resolution":{"observed_at":"2026-08-04T19:27:19.418335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-04T17:57:25.160350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10377","last_updated":"2025-09-12T16:09:39Z","snapshot_observed_at":"2026-08-08T01:06:20.404584Z","submitted_at":"2025-09-12T16:09:39Z","title":"Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:25.160350Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.10377"},"observation_digest":"sha256:88c6afe7963fa0ae48d93ff082bb980e163d2032d0035662e0f5c20ba7f2e0da","observation_id":"0283ff76-3549-4e48-8be1-a5c9d2fb79ea","resolution":{"observed_at":"2026-08-04T17:57:25.160350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-11T15:59:00.787729Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:cb02adea7288fecd948179504f03e4f9043587bda0402daa550298d82db385f3","observation_id":"d35c89df-12f2-4f4e-85cb-b42da094b9be","resolution":{"observed_at":"2026-05-18T12:41:22.803615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-03T23:41:52.898841Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-13T21:51:31.783499Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.898841Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:804006c763ec856479b4fc7c2c504326dfaa169408f6eff2f02ed9bdf98db7a7","observation_id":"1cd25960-a6da-476c-8de5-adbda4992407","resolution":{"observed_at":"2026-08-03T23:41:52.898841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-08-11T17:12:54.016914Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:4605f06dd695ec632200e206063da3f9b44ece421abf576aae5af059eaeb08b3","observation_id":"601b09f5-644d-4f07-a968-e1c972f721ed","resolution":{"observed_at":"2026-05-16T12:40:54.829536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2603.06003","last_updated":"2026-04-11T04:36:36Z","snapshot_observed_at":"2026-07-06T22:48:04.438669Z","submitted_at":"2026-03-06T08:02:58Z","title":"EvoESAP: Non-Uniform Expert Pruning for Sparse MoE","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T14:34:48.524592Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2603.06003"},"observation_digest":"sha256:6ae11f208400aa24bf1f069665128c497042c5be67fa66ee44cc09faa49c2e32","observation_id":"a8dc26dd-950c-417a-9d1e-cd7f1aa050c4","resolution":{"observed_at":"2026-05-15T14:35:55.505976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.02715","last_updated":"2026-04-30T13:29:54Z","snapshot_observed_at":"2026-08-14T09:17:53.539015Z","submitted_at":"2026-04-03T04:16:01Z","title":"FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T20:16:16.466375Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.02715"},"observation_digest":"sha256:1cb9015343ce211bcaad4624b270a0b59a2a04db981581c976be36d5b6fb59b2","observation_id":"b3989a0d-4e18-4db4-8d27-4aa2352b11a4","resolution":{"observed_at":"2026-05-13T20:18:13.308753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-08T23:43:56.161397Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:16.555166Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:607fa951e8b5402303ee865c5183c5b8feb9219ade41f9c77d7d7e4c6d75ec6a","observation_id":"46f94e26-bb0d-4f72-a72a-8bc6e83b628f","resolution":{"observed_at":"2026-05-10T03:29:21.482695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-08T23:43:56.161397Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T02:03:02.654035Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:87ec1fe3bf044ed22c42dcde5e79b1c309802fb7a28d36a4523144092fcfa9b5","observation_id":"cac8bb70-77c3-4759-b6f5-0b739b619197","resolution":{"observed_at":"2026-05-12T02:06:15.362277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.20156","last_updated":"2026-04-22T03:50:52Z","snapshot_observed_at":"2026-08-12T12:25:05.090002Z","submitted_at":"2026-04-22T03:50:52Z","title":"Temporally Extended Mixture-of-Experts Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:39:39.492135Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.20156"},"observation_digest":"sha256:e216b5b6bb69aa59bc3950d7b4fb8b33988bb381e7671475e8b6b63ec8b97676","observation_id":"94f2ab8f-a75a-49cb-acad-49e2270e6646","resolution":{"observed_at":"2026-05-10T00:39:48.314205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2604.23036","last_updated":"2026-04-24T21:48:20Z","snapshot_observed_at":"2026-08-11T02:56:27.037128Z","submitted_at":"2026-04-24T21:48:20Z","title":"Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T12:03:58.279499Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2604.23036"},"observation_digest":"sha256:a4c914e6d05bf793c653fa9669db7c7550fcb1fdeadfbc6181be5af312978c9f","observation_id":"c9372f65-d6c0-4c07-addc-dcaba4a9384f","resolution":{"observed_at":"2026-05-11T19:21:09.646812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-11T18:46:22.698604Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T06:47:25.155437Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:f41948ef79eb35d895787744538eed8c69e49705e625fa79b28b71a827a84e1d","observation_id":"042d1a9f-7455-48ff-93a5-397f2be0765d","resolution":{"observed_at":"2026-05-10T06:51:46.405151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-11T18:46:22.698604Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:d2ecd3469b322074e577cf9a82691c02601857ab2ddd603ac7a5ece333e16f96","observation_id":"a72b52a1-6a79-4870-9cc3-a46ce8901e92","resolution":{"observed_at":"2026-05-11T01:45:52.053900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-08-14T01:51:31.791296Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T03:34:10.370956Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:4d21bf1f460b2d3813b60ab82d8c5d5fdaacd5f6b170413f87229fd7a6d9f4ca","observation_id":"8b1db52f-d37f-4c5f-951d-fda88f01870b","resolution":{"observed_at":"2026-05-12T07:16:28.485473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-08-14T01:51:31.791296Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-20T23:22:51.808346Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:e9ef8f5712573730049dde6598d4d0600f3db6e6928c6c350bf6e17dd75096c9","observation_id":"8b1d5189-8889-42d4-8edc-44ec47436a21","resolution":{"observed_at":"2026-05-20T23:23:51.219912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.15484","last_updated":"2026-05-15T00:01:11Z","snapshot_observed_at":"2026-08-12T13:08:53.410986Z","submitted_at":"2026-05-15T00:01:11Z","title":"When Does Sparse MoE Help in Vision? The Role of Backbone Compute Leverage in Sparse Routing","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-19T16:21:02.198882Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.15484"},"observation_digest":"sha256:041a0c52c05db958f748b45a2602d151c697ddf13e843fcf558fb8f8936f51e5","observation_id":"a8f8732b-b5f8-480f-a672-2627725cc172","resolution":{"observed_at":"2026-05-19T16:22:39.608550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2605.23078","last_updated":"2026-05-21T22:23:38Z","snapshot_observed_at":"2026-08-02T10:30:48.658412Z","submitted_at":"2026-05-21T22:23:38Z","title":"GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T05:33:06.719954Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2605.23078"},"observation_digest":"sha256:ea43061f5ac8a7f67d87b32007cd2d2b314e07c9bd32e63f827c10aa847c1686","observation_id":"8fe14920-7977-42ae-b05a-7b40f3205cab","resolution":{"observed_at":"2026-05-25T05:36:39.868047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.00079","last_updated":"2026-05-22T13:05:53Z","snapshot_observed_at":"2026-08-05T07:27:21.222843Z","submitted_at":"2026-05-22T13:05:53Z","title":"BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T15:38:18.616792Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.00079"},"observation_digest":"sha256:6b9f351dfbe6e6af4b58ab0d3113608bb4e0384565d9fd240686d603e331d94c","observation_id":"4122790f-c394-4632-9378-fc589a2f737f","resolution":{"observed_at":"2026-06-30T15:44:48.441458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.04160","last_updated":"2026-06-02T19:23:46Z","snapshot_observed_at":"2026-08-07T08:17:37.830144Z","submitted_at":"2026-06-02T19:23:46Z","title":"Expert-Aware Refusal Steering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T10:04:13.562338Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.04160"},"observation_digest":"sha256:04517bd6a3851a596ae62e3bbec32b449b0d20943ce4a31f5bc4d79e2edca9d4","observation_id":"cd5e468b-b1a5-4354-b53c-5e4c6d067459","resolution":{"observed_at":"2026-07-02T03:26:29.122065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.18304","last_updated":"2026-06-16T06:53:27Z","snapshot_observed_at":"2026-08-09T12:16:25.770840Z","submitted_at":"2026-06-16T06:53:27Z","title":"Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T02:07:44.237002Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.18304"},"observation_digest":"sha256:37b8c43c40425983ca967f0a80acf804a531e013df52cc336db8efffc8ffe9ac","observation_id":"4959bbd2-0486-4e39-af8f-e7e1a649a509","resolution":{"observed_at":"2026-07-03T19:08:50.013861Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-03T19:08:50.012079Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large lan- guage models.arXiv preprint arXiv:2402.14800","venue":null,"work_id":"b6bdc57b-e826-4754-86c0-3e37778b253a","year":2024},"citing_paper":{"arxiv_id":"2606.29982","last_updated":"2026-06-29T08:57:59Z","snapshot_observed_at":"2026-08-12T11:37:47.617460Z","submitted_at":"2026-06-29T08:57:59Z","title":"Beyond Uniform Experts: Cost-Aware Expert Execution for Efficient Multi-Device MoE Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T04:27:02.915854Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2606.29982"},"observation_digest":"sha256:1767d4b7cfcf2420fc92775da0f7ae51bd37d9a260b6d78d9dd11a21df7347e2","observation_id":"39e3a7b9-a421-459d-a781-95c484fb4e55","resolution":{"observed_at":"2026-06-30T17:14:57.435789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-07-11T08:35:22.347459Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05116","last_updated":"2026-07-06T14:06:25Z","snapshot_observed_at":"2026-08-14T02:20:04.364719Z","submitted_at":"2026-07-06T14:06:25Z","title":"Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T08:35:22.347459Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2607.05116"},"observation_digest":"sha256:309e5b75f16caddf7f2350059c34f3d29cf809fac3daea3f1a54304c13b43422","observation_id":"c6e63b0b-f3f9-4024-b036-bbd514680b1d","resolution":{"observed_at":"2026-07-11T08:35:22.347459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.14800/citation-record","integrity":"/paper/2402.14800/integrity","json":"/paper/2402.14800/citation-record.json","paper":"/paper/2402.14800"},"outbound":[],"paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T04:12:37.239325Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2402.14800."}