{"as_of":"2026-08-09T22:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dfd4419a681a768e512a920a4975fd80ee9039af52cb77e7f93f523f641f8e4","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:34:13.994884Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:31:01.804061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:07:26.477842Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2505.18451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18451","snapshot_observed_at":"2026-07-02T23:07:26.477842Z","title":"-moe: Test-time pruning as micro-grained mixture-of-experts","venue":null,"work_id":"28e2213c-7ec0-4aea-9252-080dcaec9676","year":2025},"citing_paper":{"arxiv_id":"2606.08565","last_updated":"2026-06-07T10:43:30Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T10:43:30Z","title":"EinSort: Sorting is All We Need for Tensorizing LLM","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:01.804061Z"},"links":{"cited_paper":"/paper/2505.18451","citing_paper":"/paper/2606.08565"},"observation_digest":"sha256:c5423b547a5253f390ce0df8f7f8e8aec190300e55270b35323af114b4e7e2c0","observation_id":"ac90eb9b-e415-47cc-8e6d-dc15263edfaf","resolution":{"observed_at":"2026-07-02T23:07:26.479351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18451/citation-record","integrity":"/paper/2505.18451/integrity","json":"/paper/2505.18451/citation-record.json","paper":"/paper/2505.18451"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:13.787474Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.787474Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:accee9f0ff31baf7acfe4df5c789950bea40125664b97798fbcdbf991239cdb6","observation_id":"ee876670-2330-4ec4-836b-459be42943bf","resolution":{"observed_at":"2026-08-07T14:34:13.787474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:34:13.791615Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.791615Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:742f4990889d34876b4e9f0176b67d357e439e287ff2464c4f3189e75f348314","observation_id":"f949c38f-395b-4b26-97f6-3d4c5b2efa6b","resolution":{"observed_at":"2026-08-07T14:34:13.791615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.441623Z","title":"and Frey, B","venue":null,"work_id":"22e4e9ba-327e-4eab-80fd-3d2cd4532a3f","year":2013},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.794683Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:9436f5192765bf23a7fb47bfbe25aa793280aa51c18917dc87c6bede5a429426","observation_id":"46c4f29f-ac7b-42d1-9786-c20fe52bd580","resolution":{"observed_at":"2026-08-07T14:34:14.444940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00625","last_updated":"2024-12-29T17:38:32Z","snapshot_observed_at":"2026-08-03T07:09:22.905094Z","submitted_at":"2024-01-01T01:12:42Z","title":"Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00625","snapshot_observed_at":"2026-08-07T14:34:13.798057Z","title":"Beyond efficiency: A systematic survey of resource-efficient large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.798057Z"},"links":{"cited_paper":"/paper/2401.00625","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:7bd390e5728187d1f8e6548771dd930dc93558647b890e36aa7d47d786744358","observation_id":"eef45565-0a43-42b4-9a08-abf148bccbae","resolution":{"observed_at":"2026-08-07T14:34:13.798057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17946","last_updated":"2024-10-31T19:38:15Z","snapshot_observed_at":"2026-08-08T06:24:59.604989Z","submitted_at":"2024-02-28T00:09:07Z","title":"SparseLLM: Towards Global Pruning for Pre-trained Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17946","snapshot_observed_at":"2026-08-07T14:34:13.801474Z","title":"SparseLLM : Towards global pruning for pre-trained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.801474Z"},"links":{"cited_paper":"/paper/2402.17946","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:fd58746f53f19d89d7784637293025b38a54858360ada0eb4dc1e83cc09afa27","observation_id":"9d3130fa-c900-4122-8c3b-b58019f6b5e4","resolution":{"observed_at":"2026-08-07T14:34:13.801474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09095","last_updated":"2023-08-16T09:09:53Z","snapshot_observed_at":"2026-08-09T04:53:51.877594Z","submitted_at":"2022-12-18T14:36:07Z","title":"Rethinking the Role of Scale for In-Context Learning: An Interpretability-based Case Study at 66 Billion Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09095","snapshot_observed_at":"2026-08-07T14:34:13.805695Z","title":"Rethinking the role of scale for in-context learning: An interpretability-based case study at 66 billion scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.805695Z"},"links":{"cited_paper":"/paper/2212.09095","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:49d168f2190e8e713db0dede423d24f3b6c4c68046e43b6fc34bd784f45620de","observation_id":"8b8ad919-6076-4717-8ca9-34265405e27f","resolution":{"observed_at":"2026-08-07T14:34:13.805695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01376","last_updated":"2024-02-05T12:42:52Z","snapshot_observed_at":"2026-07-06T17:24:16.787573Z","submitted_at":"2024-02-02T13:00:38Z","title":"LoTR: Low Tensor Rank Weight Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01376","snapshot_observed_at":"2026-08-07T14:34:13.808665Z","title":"LoTR : Low tensor rank weight adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.808665Z"},"links":{"cited_paper":"/paper/2402.01376","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:6672d7a8b055867ea23aa10d01f92054021c4fe542e036c249d0af98150dba17","observation_id":"bdeb2113-6e95-425d-92ec-531e2e5e5e0f","resolution":{"observed_at":"2026-08-07T14:34:13.808665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:13.812664Z","title":"J., Frankle, J., and Guttag, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.812664Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:f03a0d3cbb04026279b924d424b87409f6c509aea555cc8138b9fbbaa431aa00","observation_id":"f7f71b19-f93c-47d1-9c1d-abc0c40fc676","resolution":{"observed_at":"2026-08-07T14:34:13.812664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T14:34:13.815632Z","title":"T., Li, Y., Lundberg, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.815632Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:1b233348e5051a19b63c38b3f5cab362742c6cea1c3b5aadf281355a338c3fa5","observation_id":"17da0630-eb63-4526-9f7e-bced5784154f","resolution":{"observed_at":"2026-08-07T14:34:13.815632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.427109Z","title":null,"venue":null,"work_id":"bc1aa742-a306-411a-b752-ed07b4187049","year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.818973Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:7fc79ec7181aed8fee925ba1316dd18640bfd13139e2e0678b79054a955dfad7","observation_id":"49fa680f-6d77-4547-a8d2-557d02095262","resolution":{"observed_at":"2026-08-07T14:34:14.430130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.417863Z","title":"Self-adaptive network pruning","venue":null,"work_id":"f6c02d25-c23e-411e-9b09-2ff46f2ff0f3","year":2019},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.822074Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:df69bba6260a98c297493df39de789a5c93f88ba2ae1627e31be985eec67ccc4","observation_id":"5dd4b55e-e924-4d72-afe0-f14f479134ea","resolution":{"observed_at":"2026-08-07T14:34:14.421042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.407962Z","title":"SuperLoRA : Parameter-efficient unified adaptation for large vision models","venue":null,"work_id":"75053f60-4532-423d-8bc0-a1b88548ae61","year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.824784Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:93e9c4ae92577ab6237e7bf186b66f3f11ff8f4cc3a3e01761272f9da8105a77","observation_id":"170aabea-943f-4017-b918-40a89dbc05e1","resolution":{"observed_at":"2026-08-07T14:34:14.411224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:34:13.827834Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.827834Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:4c434919ff2a35e3b527c00deac8b12907e900a91f33f16e53f3f10980b8765c","observation_id":"83cd6933-ec06-4df0-b1eb-f65ae61f62c2","resolution":{"observed_at":"2026-08-07T14:34:13.827834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:34:13.830800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.830800Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:9381b20e4dba6ed8dd50dc7c4282dfd435634f956fefc02651ce871b8a83aa9d","observation_id":"4bea1d77-3b4d-4ca1-9140-a9f5f1c369c1","resolution":{"observed_at":"2026-08-07T14:34:13.830800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.398039Z","title":"Learning to prune deep neural networks via layer-wise optimal brain surgeon","venue":null,"work_id":"00c58633-b4de-4989-a565-0dcafcab0fee","year":2017},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.833811Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:bd893ae18f20ac353f5739a3755748ce1ea0e5aca9e389e681cf46c5e5d0851b","observation_id":"26e789da-3908-4f1e-bffc-69b277cff1cc","resolution":{"observed_at":"2026-08-07T14:34:14.401276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10650","last_updated":"2022-12-20T20:56:52Z","snapshot_observed_at":"2026-08-09T04:51:56.558555Z","submitted_at":"2022-12-20T20:56:52Z","title":"KronA: Parameter Efficient Tuning with Kronecker Adapter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10650","snapshot_observed_at":"2026-08-07T14:34:13.836356Z","title":"P., Clark, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.836356Z"},"links":{"cited_paper":"/paper/2212.10650","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:59f0815f282bc5afa7b223541561a88b7d41617a605b538accda93d1161d4ae6","observation_id":"1f21c389-ea7c-4695-b1af-3e62eca7df98","resolution":{"observed_at":"2026-08-07T14:34:13.836356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-07T14:34:13.839374Z","title":"and Carbin, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.839374Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:56f94dcb8797ea42acbe906a370483acc4afb0fd98b47f974cd18c87a4ca1c75","observation_id":"ef101800-b5c3-4bef-a36b-b560552873b4","resolution":{"observed_at":"2026-08-07T14:34:13.839374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.388824Z","title":"and Alistarh, D","venue":null,"work_id":"29a817c5-f02d-497d-adee-4bb3accfc7eb","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.842767Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:fe229b88d6854c039a9f08c9a13cc343747136044fe6e3c0425910db8513f5ed","observation_id":"1a50bdf6-daaa-4108-b0d4-5b427fbc4a18","resolution":{"observed_at":"2026-08-07T14:34:14.392422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:34:13.846159Z","title":"GPTQ : Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.846159Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:d63a15bcf7c37075f5404323566227794b40bb0e9166c93fe3dbca2ea3acd50d","observation_id":"50985bf4-0104-480d-9ccf-95369343f996","resolution":{"observed_at":"2026-08-07T14:34:13.846159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05331","last_updated":"2019-01-28T05:25:48Z","snapshot_observed_at":"2026-08-06T15:58:12.532400Z","submitted_at":"2018-10-12T03:00:59Z","title":"Dynamic Channel Pruning: Feature Boosting and Suppression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05331","snapshot_observed_at":"2026-08-07T14:34:13.849123Z","title":"Dynamic channel pruning: Feature boosting and suppression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.849123Z"},"links":{"cited_paper":"/paper/1810.05331","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:c354e02f204efbd3ba7d036f2602048d26bd46f44e9c27d05fcf42d37ec5b458","observation_id":"3c91d95b-5209-43c1-b8a8-b80365ffc148","resolution":{"observed_at":"2026-08-07T14:34:13.849123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-07T14:34:13.852329Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.852329Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:fbca03ab4b21d94ab41aa4215085124029cee5721fd5391136ab0a7ba93b16f4","observation_id":"0752d8cf-1b0a-44a9-8ccf-c2f6b0c09bd4","resolution":{"observed_at":"2026-08-07T14:34:13.852329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.379129Z","title":"Optimal brain surgeon: Extensions and performance comparisons","venue":null,"work_id":"396d970f-006c-41e1-bf55-70c3b1e8e82e","year":1993},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.855376Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:29dfe8bb99053264397d54372b6e76688a8c897007cc254d31e1ca977cdab75c","observation_id":"5cb217d8-b2e4-47b1-8841-66d15dd0b820","resolution":{"observed_at":"2026-08-07T14:34:14.382469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-07T14:34:13.858580Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.858580Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:e86d89ae846922c17d2f22f618ba4f795d27e96b05b25221de0f466da4947def","observation_id":"39f65531-9169-446a-8f27-0c4fd5e8ebda","resolution":{"observed_at":"2026-08-07T14:34:13.858580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.370450Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W., et al","venue":null,"work_id":"25c162c5-a661-485e-8f3d-61b7386387bf","year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.861450Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:3576cbe2f8ae536bb0aa1f2d8b07983d56677cb7f41b2838714d21031566fd86","observation_id":"28fc2637-ca29-40d8-b830-58b9af7f2d71","resolution":{"observed_at":"2026-08-07T14:34:14.373761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.361038Z","title":"M., Zhang, Z., and Suh, G","venue":null,"work_id":"9f9fec03-c71c-4528-9032-4d1a9c2bb94d","year":2019},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.864543Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:6c5e4be5ea629f94c6a981e0aed6fd39707c384317193506bf851c5782edf9fd","observation_id":"a6cdd1bb-35e6-48ee-b2f9-4bd6f3ca3117","resolution":{"observed_at":"2026-08-07T14:34:14.364521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09117","last_updated":"2024-06-13T13:44:31Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T13:44:31Z","title":"PC-LoRA: Low-Rank Adaptation for Progressive Model Compression with Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09117","snapshot_observed_at":"2026-08-07T14:34:13.867971Z","title":"PC-LoRA : Low-rank adaptation for progressive model compression with knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.867971Z"},"links":{"cited_paper":"/paper/2406.09117","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:b0b1bd52ab5978863163ca28ad1f43434f508b0520cd38c83ff9fdf18c550327","observation_id":"d9013bcf-e0e6-4bfa-a425-d17696d0c489","resolution":{"observed_at":"2026-08-07T14:34:13.867971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T14:34:13.871657Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.871657Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:2fe0a799f0d2a4416db70f732f3a8843911da29b6094e333799598932a5a71f9","observation_id":"eb6f0547-a548-44c9-b1de-e76b457560b2","resolution":{"observed_at":"2026-08-07T14:34:13.871657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.353158Z","title":"M., Bommarito, M","venue":null,"work_id":"936ea410-85f3-443d-ba70-eb02d5cf8e86","year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.874682Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:258b0cb2e1951743224b19fe4f2c32cc4df71aec5bd3cae82f7477772f291541","observation_id":"dd945c07-2587-4011-8445-152c43f3944b","resolution":{"observed_at":"2026-08-07T14:34:14.356067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05431","last_updated":"2025-03-07T14:01:25Z","snapshot_observed_at":"2026-08-07T17:22:06.049046Z","submitted_at":"2025-03-07T14:01:25Z","title":"Quantum-PEFT: Ultra parameter-efficient fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05431","snapshot_observed_at":"2026-08-07T14:34:13.877813Z","title":"Z., Candogan, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.877813Z"},"links":{"cited_paper":"/paper/2503.05431","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:19eb31ec9413f5afc229ce17e396e2c0b3797427e5f8643da92f3f106875b39f","observation_id":"5adfa46e-d7cc-4f9c-8c71-6f722ba268b6","resolution":{"observed_at":"2026-08-07T14:34:13.877813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-07T14:34:13.881134Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.881134Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:e5bd05209caad801ae691313e4a9bda0166eead0dbd70d8fe0be8ac1460c98c9","observation_id":"6c3b664d-2096-4764-b95b-9e2381eac861","resolution":{"observed_at":"2026-08-07T14:34:13.881134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:13.884160Z","title":"Optimal brain damage","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.884160Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:c64ccda8d45ec361af275c2ddbabdef1d59cd0a3bbf9a1951549458e2a384c0b","observation_id":"0cfdc33f-14ff-4ffd-a6b9-8c4e6bea281e","resolution":{"observed_at":"2026-08-07T14:34:13.884160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T14:34:13.887072Z","title":"MoE-LlaVa : Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.887072Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:bec611d49ae46cab2b031e6362344c5f5024efb8d2fed68104e435e2256b080a","observation_id":"f33e0535-9d70-4269-8099-058e709249d7","resolution":{"observed_at":"2026-08-07T14:34:13.887072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.338126Z","title":"Runtime neural pruning","venue":null,"work_id":"b4c7ba11-e2dc-4c38-a125-3dfd1bc9e3c9","year":2017},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.890370Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:09e50ca57574ccf9d9da403581915f04fd8ee7664114312d3da12f3abfb2c7cd","observation_id":"26512cfe-c1cc-4579-9fc1-f63942fc3ef0","resolution":{"observed_at":"2026-08-07T14:34:14.340848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.328863Z","title":"AWQ : Activation-aware weight quantization for on-device LLM compression and acceleration","venue":null,"work_id":"bb757283-c1db-4a80-9533-d9d954d7604f","year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.893509Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:69d0fa19bb5274a91886617d2723d7bc0bcc8e9161ef689b1c06c8941e1c6ed1","observation_id":"76e9a70a-242e-40ce-a59f-4595f3a4f6c0","resolution":{"observed_at":"2026-08-07T14:34:14.333035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:34:13.896670Z","title":"DeepSeek -v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.896670Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:93f43b2f6b40565b1386d66b481bdeee9e8246d8126b51b3f8ab168efaa19d75","observation_id":"8927a97a-e79a-4fcb-a8d7-c3d2e3f3ece9","resolution":{"observed_at":"2026-08-07T14:34:13.896670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.321297Z","title":null,"venue":null,"work_id":"5be3dadf-b004-4f0a-9035-e657c18d5640","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.899793Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:13b2b82bd6c476371269dfc721346687081c83c5fa07aeeeef2117f6bea0e5c1","observation_id":"03eda01b-3e32-41be-8467-27aba183f195","resolution":{"observed_at":"2026-08-07T14:34:14.324017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.313192Z","title":"LoDA : Low-dimensional adaptation of large language models","venue":null,"work_id":"ea09e1a0-0380-4fc5-b0f7-0c3a44a0ec3f","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.902989Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:6485ffcf5d664e4361a2c59f24877fe0d3bb4a770c0b79c569f4b3029a2787cf","observation_id":"3bab24ca-7da2-4940-82a7-61158f45f569","resolution":{"observed_at":"2026-08-07T14:34:14.316279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.305152Z","title":"and Deng, J","venue":null,"work_id":"53b8520b-c83d-4766-b746-aa8920119363","year":2018},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.910492Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:2943b81c36e0cf71876e18889e1bb7ce3a8f2770c3410a605f02b15ed0c665c4","observation_id":"61563575-7d27-413b-8563-453d8dc7da78","resolution":{"observed_at":"2026-08-07T14:34:14.307513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.296247Z","title":"Deja vu: Contextual sparsity for efficient LLMs at inference time","venue":null,"work_id":"70cca263-8bc1-4f67-a773-114ee38c0074","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.912697Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:94e2aeb960d089ef16700f4258378a8fe3900950a7d85042a5364ebdf74230eb","observation_id":"d32545e3-f1a2-4292-b7cf-8afdb7c15a47","resolution":{"observed_at":"2026-08-07T14:34:14.299985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:13.915167Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.915167Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:543abe376de85fabfc4fcb366853cf698eee3dd35db45023f2b240002951100e","observation_id":"96cf4937-1287-412e-a9e5-f09d44f4cf6a","resolution":{"observed_at":"2026-08-07T14:34:13.915167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.284506Z","title":"LLM-Pruner : On the structural pruning of large language models","venue":null,"work_id":"67dda938-a5f3-425b-af11-6b965678b5b2","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.917703Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:e9e9fbc8cee6db3f580e748482b665b728090477828cc0a4ff2d9f028334b47e","observation_id":"6afc8624-bca3-443d-8f9b-b6d7c390a8ae","resolution":{"observed_at":"2026-08-07T14:34:14.287191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.276657Z","title":"A., MacIntyre, R., Bies, A., Ferguson, M., Katz, K., and Schasberger, B","venue":null,"work_id":"d2d3466b-588c-469d-8b3b-9aeeb73d55f0","year":1994},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.920783Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:c1b0f9208636b6bb4e84714195dd347aa5d42749980ba6642ff6e8afef2eeb66","observation_id":"a74ca4bf-06c8-4a46-a61c-3d27bfb6f637","resolution":{"observed_at":"2026-08-07T14:34:14.279609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T14:34:13.923252Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.923252Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:68ef4deb310c288fb519f62820aa3370bd52f8123cd48a7e432a9c3ea8158e0d","observation_id":"50c8ad7f-3da4-4ee4-bd80-1e0aa9b5722f","resolution":{"observed_at":"2026-08-07T14:34:13.923252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:34:13.925903Z","title":"L., Fei-Fei, L., Hajishirzi, H., Zettlemoyer, L., Liang, P., Cand \\`e s, E., and Hashimoto, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.925903Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:8ca191ddc6276aa5c8634f4b490784e546662680959ac6f313cfa42656e03d10","observation_id":"18549d90-38ae-4156-9f47-889ffbb24308","resolution":{"observed_at":"2026-08-07T14:34:13.925903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:13.928816Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.928816Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:45235e69e2a901b18620a1e4a018e243423ed3b7878beb01f3b01b3916588f27","observation_id":"d236fffd-223c-4872-9ead-fbba587d87a9","resolution":{"observed_at":"2026-08-07T14:34:13.928816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.263924Z","title":"Compressing large language models using low rank and low precision decomposition","venue":null,"work_id":"1a10bbc0-c1fc-44d9-b9a5-cf4dd78437aa","year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.931708Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:6da842253e140c6a0ce6bbe988522273f08dbbe62a88ccde582ca066a350dfd2","observation_id":"1f7b0fcc-ed40-4efd-9eb3-bd89f46f4956","resolution":{"observed_at":"2026-08-07T14:34:14.267442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05646","last_updated":"2024-11-08T16:29:33Z","snapshot_observed_at":"2026-08-09T17:23:55.704481Z","submitted_at":"2024-08-10T22:47:12Z","title":"Eigen Attention: Attention in Low-Rank Space for KV Cache Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05646","snapshot_observed_at":"2026-08-07T14:34:13.934567Z","title":"Eigen attention: Attention in low-rank space for KV cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.934567Z"},"links":{"cited_paper":"/paper/2408.05646","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:1d944233c489f35e69c0dd5d72636d9b175d38ef7e9fe3ce4ac2eb724634d911","observation_id":"d1f11b3d-665c-4ddd-b9c9-f53f6941d291","resolution":{"observed_at":"2026-08-07T14:34:13.934567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.256584Z","title":"A., and Etzioni, O","venue":null,"work_id":"8dfcb0c3-e33a-4a85-831e-b8bcb46425ff","year":2020},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.938191Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:881beb2c7e7541f7c4a481c748bc16ad04e1e35118889462574ca64f7e60e9ed","observation_id":"02caee79-fff0-472b-bd1a-c8bbab540aca","resolution":{"observed_at":"2026-08-07T14:34:14.259185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.248573Z","title":"Towards VQA models that can read","venue":null,"work_id":"88196b1f-211d-461c-9f74-20cebd87537c","year":2019},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.941617Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:8df365778363269416aace5d46cd526026b6fd3c55c3aefe8bcb393988e2d8f9","observation_id":"1aa9924e-3729-43b0-8e92-f803296899a9","resolution":{"observed_at":"2026-08-07T14:34:14.252038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T14:34:13.944075Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.944075Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:0595b7f560640869312d41ca0984f10924af63a33cd327d288def5583104e91d","observation_id":"e049edea-7f38-4cb7-a919-6349feb4e37a","resolution":{"observed_at":"2026-08-07T14:34:13.944075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:34:13.947163Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.947163Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:4fb66eba7a91957828c904d3ac5a4572d935ff02c5b39c41c20031adaec33d78","observation_id":"e80ca720-5bda-4112-b45d-3cd1b3bd1363","resolution":{"observed_at":"2026-08-07T14:34:13.947163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04827","last_updated":"2023-09-09T15:51:36Z","snapshot_observed_at":"2026-08-03T03:23:53.991142Z","submitted_at":"2023-09-09T15:51:36Z","title":"Neurons in Large Language Models: Dead, N-gram, Positional","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04827","snapshot_observed_at":"2026-08-07T14:34:13.950136Z","title":"Neurons in large language models: Dead, n-gram, positional","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.950136Z"},"links":{"cited_paper":"/paper/2309.04827","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:4af6ec1c3c70af105c83c9dfa65046dea4ecb45ebac736ed2ec85bd60f6e1c2e","observation_id":"d6b19cdb-4c2a-495e-90ca-1dc772238a2a","resolution":{"observed_at":"2026-08-07T14:34:13.950136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08119","last_updated":"2025-02-24T01:36:56Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:02:48Z","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08119","snapshot_observed_at":"2026-08-07T14:34:13.953373Z","title":"Q-VLM : Post-training quantization for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.953373Z"},"links":{"cited_paper":"/paper/2410.08119","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:75b1486d081d52066732de18c255c4550b52a66b0597c3cd6b561163f94a7513","observation_id":"aee252e7-274c-4e48-941a-fc682c41b9f7","resolution":{"observed_at":"2026-08-07T14:34:13.953373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12410","last_updated":"2022-11-02T02:47:17Z","snapshot_observed_at":"2026-08-09T21:04:05.676909Z","submitted_at":"2022-05-24T23:41:22Z","title":"AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12410","snapshot_observed_at":"2026-08-07T14:34:13.956079Z","title":"H., and Gao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.956079Z"},"links":{"cited_paper":"/paper/2205.12410","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:62266a390e761d414be5203cc41b6f42e3587dab5ead609e2e49d1fdcad0309d","observation_id":"74356825-c5d8-4ae4-92fc-f145cd119c30","resolution":{"observed_at":"2026-08-07T14:34:13.956079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T14:34:13.959508Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.959508Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:43802663f2f57e9bcd90a7b8a38a8880b28b5b6be7cda92aed0fb73a63b63b29","observation_id":"c80aa666-790e-4d4e-b564-876da6c1ae34","resolution":{"observed_at":"2026-08-07T14:34:13.959508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09755","last_updated":"2024-08-12T17:57:00Z","snapshot_observed_at":"2026-07-06T16:48:29.239105Z","submitted_at":"2023-11-16T10:30:00Z","title":"On the Impact of Calibration Data in Post-training Quantization and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09755","snapshot_observed_at":"2026-08-07T14:34:13.962578Z","title":"and Aletras, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.962578Z"},"links":{"cited_paper":"/paper/2311.09755","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:c77c0f8a77c011061cdd181e862877fed3808c32123d41e27e8602a0243103f8","observation_id":"d6e59e3c-955e-45d6-9b20-4671e59d86f2","resolution":{"observed_at":"2026-08-07T14:34:13.962578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13628","last_updated":"2024-04-21T11:59:53Z","snapshot_observed_at":"2026-08-09T06:38:31.305949Z","submitted_at":"2024-04-21T11:59:53Z","title":"Mixture of LoRA Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13628","snapshot_observed_at":"2026-08-07T14:34:13.965720Z","title":"Mixture of LoRA experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.965720Z"},"links":{"cited_paper":"/paper/2404.13628","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:48e77685e3e5f7e25642139d4a73a8381c56fd921cbce2dbfba680c1604606bf","observation_id":"3a462e31-55e9-4610-b288-d2a854defeb3","resolution":{"observed_at":"2026-08-07T14:34:13.965720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.240227Z","title":"Automated fine-grained mixture-of-experts quantization","venue":null,"work_id":"d760f7f1-2416-49f3-9803-54aed71d82ab","year":null},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.969148Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:27732cb2bcba6b1cd598a6caf5a349fbfd72bbdc857c4555d38aba91a25e932a","observation_id":"7fd4be8c-c017-4ec8-9b3e-8aea1444ce97","resolution":{"observed_at":"2026-08-07T14:34:14.242855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.233445Z","title":"and McAuley, J","venue":null,"work_id":"65f7f875-cd63-4323-957f-0215d69fc5b0","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.972366Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:3b96ef6634b2c8d5234f58ed286982b3e0fd980602498c197772007ff49b5bc1","observation_id":"8d23655c-c2c4-4b3b-a3f7-f75b967a4cfd","resolution":{"observed_at":"2026-08-07T14:34:14.235809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19948","last_updated":"2025-02-27T10:17:02Z","snapshot_observed_at":"2026-08-07T17:43:22.487273Z","submitted_at":"2025-02-27T10:17:02Z","title":"Dynamic DropConnect: Enhancing Neural Network Robustness through Adaptive Edge Dropping Strategies","version":1},"cited_work":{"arxiv_id":"2502.19948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19948","snapshot_observed_at":"2026-08-07T14:34:14.038700Z","title":"Dynamic DropConnect: Enhancing Neural Network Robustness through Adaptive Edge Dropping Strategies","venue":"cs.LG","work_id":"5b560809-10cc-4714-90ae-5c82218b6b1c","year":2025},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.975479Z"},"links":{"cited_paper":"/paper/2502.19948","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:04dae23b81a95e2457da5d463b23f09060ee5342ff6f8b41013a7ed4c87cc86b","observation_id":"9a337ed3-03b6-45f9-8b61-c59b2437bec0","resolution":{"observed_at":"2026-08-07T14:34:14.043464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:14.226093Z","title":"B., Oh, G., and Gong, Y","venue":null,"work_id":"91ca0cef-6cea-49cf-abce-2bdf4c4a1833","year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.978900Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:443064fcaf5a27a9ab56cac0a77b9de21558a1edc8f748f7ff4e592ea3091778","observation_id":"fadc69d6-cdb5-4ef8-8e74-77bbbd2636ba","resolution":{"observed_at":"2026-08-07T14:34:14.228716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05821","snapshot_observed_at":"2026-08-07T14:34:13.981845Z","title":"ASVD : Activation-aware singular value decomposition for compressing large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.981845Z"},"links":{"cited_paper":"/paper/2312.05821","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:dc83f1ae5d2fc6564dba903c90dc4c3571d7204935ce789efa35b125b5569404","observation_id":"ea281f70-f4a6-4f13-a1c6-4c2b714b6f29","resolution":{"observed_at":"2026-08-07T14:34:13.981845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:34:13.984961Z","title":"J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.984961Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:c6c0f320605a41087d789fc5365b764dab7817e8ce5c94cbfe18d06d55256cd0","observation_id":"50a59906-288a-4c38-990d-e47abb93f1d2","resolution":{"observed_at":"2026-08-07T14:34:13.984961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18035","last_updated":"2024-10-23T17:04:40Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:04:40Z","title":"MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18035","snapshot_observed_at":"2026-08-07T14:34:13.988161Z","title":"MiLoRA : Efficient mixture of low-rank adaptation for large language models fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.988161Z"},"links":{"cited_paper":"/paper/2410.18035","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:8df6766630142b9b3d30ac65fb9a2a048be1756d17f4b6969200c90bffa32cbf","observation_id":"6f5d9620-8a44-4c18-9b86-07c3e9a809a7","resolution":{"observed_at":"2026-08-07T14:34:13.988161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T14:34:13.991374Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.991374Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:da1a7266490b58d78807d17e91227b1cdf9f9e2ce330115f09eaf3b1e4227329","observation_id":"976eab98-3f95-4cee-97ea-bc7c93868804","resolution":{"observed_at":"2026-08-07T14:34:13.991374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:13.994884Z","title":"A survey on model compression for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.994884Z"},"links":{"citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:05032538e4e32ba69702491d07ce57e1087f4bd6c053b8293a95f8adde86dc48","observation_id":"44f25647-acb7-479c-8089-72820110f2f4","resolution":{"observed_at":"2026-08-07T14:34:13.994884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2505.18451."}