{"as_of":"2026-08-12T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67c673986c07dd1b65c97a5a43dcf3694f337ab335b0d9c36ce75502cf6b617e","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:49:01.983631Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07890/citation-record","integrity":"/paper/2608.07890/integrity","json":"/paper/2608.07890/citation-record.json","paper":"/paper/2608.07890"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:01.879932Z","title":"DiEP: Adaptive mixture-of-experts compression through differentiable expert pruning.arXiv preprint arXiv:2509.16105, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.879932Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:13eec2fd483b2624777d6fda56098ca01c0606d9e7824af6f1d4707dbe8fb9ff","observation_id":"891266e0-263e-4b0a-812c-2e19b7558e02","resolution":{"observed_at":"2026-08-12T00:49:01.879932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00277","last_updated":"2022-06-02T03:44:04Z","snapshot_observed_at":"2026-08-10T23:05:00.856772Z","submitted_at":"2022-06-01T07:09:01Z","title":"Task-Specific Expert Pruning for Sparse Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00277","snapshot_observed_at":"2026-08-12T00:49:01.883488Z","title":"Task-specificexpertpruningforsparsemixture-of-experts.arXiv preprint arXiv:2206.00277, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.883488Z"},"links":{"cited_paper":"/paper/2206.00277","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:11616b3e59a3c3203a729f216b60a2f4375e31bf7224465212aa8439c51d70f4","observation_id":"8e4da1fb-5c05-4358-9927-35aed7e48002","resolution":{"observed_at":"2026-08-12T00:49:01.883488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.588059Z","title":"A provably effective method for pruning experts in fine-tuned sparse mixture-of-experts","venue":null,"work_id":"d0029d5c-af44-481d-9a08-1c67d1caf50f","year":null},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.886972Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:fda526d8ac387a985a8886c1c9fc97599928685d9aeff6bc7d473109c83c28ea","observation_id":"62b39d4a-1d0a-409e-8ab1-43192e79e837","resolution":{"observed_at":"2026-08-12T00:49:02.591859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.578329Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"bccbb388-fec0-451d-a1c0-f2d5f653711b","year":2019},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.890345Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:4045a6dc92f2fc4b7e07869395597e772ed8dbf543a985065e9a8c4541124fc8","observation_id":"fde8606f-f69b-4ae0-a773-5cc57c8d90a9","resolution":{"observed_at":"2026-08-12T00:49:02.581959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-12T00:49:01.893687Z","title":"Think you have solved question answering? try ARC, the AI2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.893687Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:fe5381462c00081aecbbbae4de1086ae9fc765e7a65bba36320751e79f435bae","observation_id":"afac1b59-746f-4cd5-abfb-41c7e752b8b5","resolution":{"observed_at":"2026-08-12T00:49:01.893687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T00:49:01.897288Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.897288Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:de8eaafd10683a05c2b5848460d450c7b203e38954ec55a758c5528eb0c12f5b","observation_id":"e3ca1928-df1c-4ea2-abf1-5a6354dd8255","resolution":{"observed_at":"2026-08-12T00:49:01.897288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-12T06:03:03.703202Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T00:49:01.900748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.900748Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:0fe1a5c6847713922690001702cf317c99edc722bb88cff9515f576aff981ea7","observation_id":"084f6780-ac34-4150-865a-b0b9955df576","resolution":{"observed_at":"2026-08-12T00:49:01.900748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-12T00:49:01.904132Z","title":"QLoRA: Efficient finetun- ing of quantized LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.904132Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:18e9d095efba55fab56ab337e7e26972e9b100f7b3d23ba778bbe08484fcd3f6","observation_id":"157e458a-320c-46ce-976c-6967b58d8805","resolution":{"observed_at":"2026-08-12T00:49:01.904132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.568490Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":"837dd943-eefd-4400-90d8-0e1527ccfcba","year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.908739Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:7303960e88ac4443e205aa7daa3dee1097d512b8af742f675d1f624d0c509ce5","observation_id":"036ee345-af6c-415f-8f2b-39506d163821","resolution":{"observed_at":"2026-08-12T00:49:02.572169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.558803Z","title":"LightEval: A lightweight framework for LLM evaluation.https://github.com/huggingface/lighteval, 2023","venue":null,"work_id":"e5282afc-ed0e-4869-b961-0795821740ef","year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.911735Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:097396be296ee89523dd2cf98598166d155a35dc8a9c240738bda3348daeacb6","observation_id":"a4f1cfb4-d4c0-4ede-8a9e-9160c8263fe2","resolution":{"observed_at":"2026-08-12T00:49:02.562429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.548672Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"97ac79f2-f5e1-4e2b-b8cf-d07284dcf49b","year":2019},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.914668Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:e71b7f0c34ed9c8932fb0b684556c6f229499a194cca0e72da4ce65ede92e24a","observation_id":"6eb2fba6-29fb-4a7f-88c4-ed08907ba91b","resolution":{"observed_at":"2026-08-12T00:49:02.552596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T00:49:01.917699Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.917699Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:543f5cdc6f00f2bcea3a535536c5bd1f0cfc12cbaf7ce03b6868f2b7e7c3374a","observation_id":"918bfb6e-f589-4bae-98a8-343eaf2f895f","resolution":{"observed_at":"2026-08-12T00:49:01.917699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10159","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.364751Z","title":"Whatgetsactivated: Uncovering domain and driver experts in MoE language models.arXiv preprint arXiv:2601.10159, 2026","venue":null,"work_id":"b9b82e88-1e04-4471-bac1-3d8e953d29d0","year":2026},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.920863Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:877b4fbf97a03e5b03e62cb8c6b4840889bae72caec70d85229211ab3af588a6","observation_id":"fb1789aa-30a0-4585-8c56-62f9d3a1e00e","resolution":{"observed_at":"2026-08-12T00:49:02.370354Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.02217","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.298582Z","title":"Isretraining-freeenough? thenecessityofroutercalibrationforefficient MoE compression.arXiv preprint arXiv:2603.02217, 2026","venue":null,"work_id":"49d85b96-4daa-41d8-8d02-6a0ba6b64b19","year":2026},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.923986Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:1a51a02130b3db7f1983eba049753461685334ea37619e300b4509f4fe15ebac","observation_id":"ada29a1d-99c0-4f84-9947-0cfbe04b5298","resolution":{"observed_at":"2026-08-12T00:49:02.303879Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05586","last_updated":"2025-04-10T02:32:14Z","snapshot_observed_at":"2026-08-07T16:07:44.934790Z","submitted_at":"2025-04-08T00:49:08Z","title":"Finding Fantastic Experts in MoEs: A Unified Study for Expert Dropping Strategies and Observations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05586","snapshot_observed_at":"2026-08-12T00:49:01.926938Z","title":"Finding fantastic experts in MoEs: A unified study for expert dropping strategies and observations.arXiv preprint arXiv:2504.05586, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.926938Z"},"links":{"cited_paper":"/paper/2504.05586","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:1c4445efe2b2db0cfa3bb87912881e8e88010373b690262b8426725e9053474d","observation_id":"61fbfbd6-6321-458f-afce-2f8738c702b4","resolution":{"observed_at":"2026-08-12T00:49:01.926938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T00:49:01.930118Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.930118Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:e462328ba354300d47a562507c4dd4e8c763cddcae82b1f8b49da54416cdb809","observation_id":"668edeb3-9b5b-46f8-9d2e-8c89499caea9","resolution":{"observed_at":"2026-08-12T00:49:01.930118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.538248Z","title":"Memory-efficient NLLB-200: Language-specificexpertpruningofamassivelymultilingualmachinetranslationmodel","venue":null,"work_id":"da620981-7161-4ee4-8a16-a7fd0cdd1646","year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.933211Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:77b3261b6f49d8d74931935ba86e46f455fe7eb10429672c6cc4d5fe304abeb9","observation_id":"70273fa2-e53b-49f0-b876-25863bed257d","resolution":{"observed_at":"2026-08-12T00:49:02.542119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13999","last_updated":"2026-05-13T04:13:39Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T18:29:28Z","title":"REAP the Experts: Why Pruning Prevails for One-Shot MoE compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13999","snapshot_observed_at":"2026-08-12T00:49:01.936166Z","title":"REAP the experts: Why pruning prevails for one-shot MoE compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.936166Z"},"links":{"cited_paper":"/paper/2510.13999","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:9b8441c002ed230bfa64e0f2a9039031ffd1c0c1443710a3f505632d049444d5","observation_id":"c0aaf6a8-0f4e-4399-a981-702dd0f0062f","resolution":{"observed_at":"2026-08-12T00:49:01.936166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T00:49:01.939879Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.939879Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:43b7f03ea0a811644968213c7fd814214668187b335b35910ab305e844fec07b","observation_id":"8bbb5269-70e9-497e-a708-2d9b61e8cda6","resolution":{"observed_at":"2026-08-12T00:49:01.939879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01334","last_updated":"2024-03-14T11:01:15Z","snapshot_observed_at":"2026-08-10T02:42:46.388949Z","submitted_at":"2023-10-02T16:51:32Z","title":"Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01334","snapshot_observed_at":"2026-08-12T00:49:01.943207Z","title":"Merge, then compress: Demystify efficient SMoE with hints from its routing policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.943207Z"},"links":{"cited_paper":"/paper/2310.01334","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:7804b2a08332cc3db71ccb296254aa84898d5f33446bc51547e80d88c7780356","observation_id":"c9863d2d-eca5-4e8a-ab06-bd41c10e4a7e","resolution":{"observed_at":"2026-08-12T00:49:01.943207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.527906Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":"5bde4aab-12cc-46cb-b158-5816a0d1b98e","year":2021},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.946445Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:0848cb9a5a871f1b5ddb7117505332ee7250b23ab672e343f9a01eafd05d4b54","observation_id":"bf37a876-1492-4c08-936b-a8f028faad5f","resolution":{"observed_at":"2026-08-12T00:49:02.531509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00945","last_updated":"2024-07-01T03:57:35Z","snapshot_observed_at":"2026-08-05T13:26:03.230242Z","submitted_at":"2024-07-01T03:57:35Z","title":"Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00945","snapshot_observed_at":"2026-08-12T00:49:01.949181Z","title":"Blaschko, Shengen Yan, Guohao Dai, Huazhong Yang, and Yu Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.949181Z"},"links":{"cited_paper":"/paper/2407.00945","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:8bcad3b260d3c5376729a43a82e6087459274de582a09cc820844e55aa3bbd6e","observation_id":"a541499f-7628-4625-b67e-c2c8ef29dd68","resolution":{"observed_at":"2026-08-12T00:49:01.949181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05638","last_updated":"2022-08-26T16:23:29Z","snapshot_observed_at":"2026-07-06T13:08:59.614061Z","submitted_at":"2022-05-11T17:10:41Z","title":"Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05638","snapshot_observed_at":"2026-08-12T00:49:01.952312Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.952312Z"},"links":{"cited_paper":"/paper/2205.05638","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:a26a94e8d2a869cf637a2629eccebde580dbdd6f7a9374135eb7d04d49028b41","observation_id":"91488c25-d831-41dd-938f-b4306befc0b7","resolution":{"observed_at":"2026-08-12T00:49:01.952312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.517593Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":"59acda52-99c1-418e-853e-3794f4df0311","year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.955798Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:83d37f79950e3b7de25597356420dbf875dd88a3f99d82c54a317a8e6884b94d","observation_id":"1501c59d-cf2d-4ce1-9022-527a23fa0ca4","resolution":{"observed_at":"2026-08-12T00:49:02.521484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.507339Z","title":null,"venue":null,"work_id":"1bef47ce-f146-4fdf-9eba-0703894716cc","year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.958734Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:696461c11210871a2c0e2e8532ecb6e71674a8a68e47baafbf78046a5489a05a","observation_id":"3ef82a77-8cde-4d14-b1a4-1ebfe6ae5d10","resolution":{"observed_at":"2026-08-12T00:49:02.511001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05089","last_updated":"2024-04-07T22:13:43Z","snapshot_observed_at":"2026-08-10T22:55:54.897620Z","submitted_at":"2024-04-07T22:13:43Z","title":"SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05089","snapshot_observed_at":"2026-08-12T00:49:01.961675Z","title":"SEER-MoE:Sparseexpertefficiencythroughregularization for mixture-of-experts.arXiv preprint arXiv:2404.05089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.961675Z"},"links":{"cited_paper":"/paper/2404.05089","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:ed553cacaf5a5064797f0b2dcaa7e2d1bb859ef9c550f92191c0fbfbb22a5443","observation_id":"9e90403c-22a1-48db-9172-f5027fa6feb6","resolution":{"observed_at":"2026-08-12T00:49:01.961675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.495573Z","title":"Qwen1.5-MoE: Matching 7B model performance with 1/3 activated parameters.https: //qwenlm.github.io/blog/qwen-moe/, 2024","venue":null,"work_id":"44ea5d0e-e696-4283-896b-7c51bca04938","year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.964966Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:176f86b71a719c740446807435dca308c8efbd4f069480e3b2c4d05167fbda32","observation_id":"97a3bce9-c087-4993-9250-a946bc1fff60","resolution":{"observed_at":"2026-08-12T00:49:02.500646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-12T04:14:58.866318Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T00:49:01.967993Z","title":"Outrageouslylargeneuralnetworks: Thesparsely-gatedmixture-of-expertslayer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.967993Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:1d04973e3b2011fd2154b341d3363f8e7618f13d31ef67d3b1b0564d800751ef","observation_id":"7e846139-9d62-4abc-bce9-962c39b09373","resolution":{"observed_at":"2026-08-12T00:49:01.967993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-12T00:49:01.971209Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.971209Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:d0568ec1b8a8b20de3fa184a395c625127a20a051fb4748d750aad9189f2a625","observation_id":"b984f894-7398-4769-a8da-7eb04e365d00","resolution":{"observed_at":"2026-08-12T00:49:01.971209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.485020Z","title":"LoRA without regret","venue":null,"work_id":"87a778da-8b4d-4665-8ee2-1689b76a8843","year":null},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.974351Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:99e57be533ed7202e29e3373fbea8215c32ab69d60956c71becdf6ec840ea454","observation_id":"1c1ff876-aaa7-4670-b552-d97ffb4eab24","resolution":{"observed_at":"2026-08-12T00:49:02.488748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-12T00:49:01.977418Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.977418Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:da33b2b1c71cec098f992cd5c1fb8b3064faea8e2d88127c79beb54c3460e0e3","observation_id":"717cab9f-b213-46b4-b318-1b12bb4fa1b3","resolution":{"observed_at":"2026-08-12T00:49:01.977418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12013","last_updated":"2024-10-15T19:22:27Z","snapshot_observed_at":"2026-07-06T19:34:10.252984Z","submitted_at":"2024-10-15T19:22:27Z","title":"MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12013","snapshot_observed_at":"2026-08-12T00:49:01.980607Z","title":"MoE-Pruner: Pruning mixture-of-experts large language model using the hints from its router.arXiv preprint arXiv:2410.12013, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.980607Z"},"links":{"cited_paper":"/paper/2410.12013","citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:aa5818801e0024d55318231de2225881740eac86d38117a55a3d1b878937eb3b","observation_id":"e1e88265-d0c6-4b5e-8580-a9fd5f552264","resolution":{"observed_at":"2026-08-12T00:49:01.980607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18425","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:49:02.105863Z","title":"MoE pathfinder: Trajectory-driven expert pruning.arXiv preprint arXiv:2512.18425, 2025","venue":null,"work_id":"467947ae-b74d-4c4a-879c-1fa01b257ce1","year":2025},"citing_paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:49:01.983631Z"},"links":{"citing_paper":"/paper/2608.07890"},"observation_digest":"sha256:afb942985c0aabb82896cb9ad4ac8cf1db84dbdd2361f26e632a30b8c80c4536","observation_id":"24536dcf-c66d-4c6a-baf5-5c06b7590a19","resolution":{"observed_at":"2026-08-12T00:49:02.113892Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07890","last_updated":"2026-08-08T03:36:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T21:13:48.692262Z","submitted_at":"2026-08-08T03:36:41Z","title":"Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.07890."}