{"as_of":"2026-08-09T21:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:821354f6b33e11d02867e36b0c2056ebf4ea06be014e6817f3daa4e17e0bfdda","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:41:52.952675Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:51:34.294269Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T12:43:25.643835Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04805","snapshot_observed_at":"2026-08-03T09:32:55.640537Z","title":"Puzzle- moe: Efficient compression of large mixture-of-experts models via sparse expert merging and bit-packed infer- ence.arXiv preprint arXiv:2511.04805, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13563","last_updated":"2026-07-08T11:01:48Z","snapshot_observed_at":"2026-08-07T13:12:39.905456Z","submitted_at":"2026-01-20T03:39:33Z","title":"ButterflyMoE: Compression-Scalable Ternary Experts via Structured Butterfly Orbits","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:32:55.640537Z"},"links":{"cited_paper":"/paper/2511.04805","citing_paper":"/paper/2601.13563"},"observation_digest":"sha256:bc6efb4cd28b323b01a6b8412202222126cd7f790e87101afecd85946b44ad81","observation_id":"35e6eba3-7f8f-4c47-9480-71d5faa9e20b","resolution":{"observed_at":"2026-08-03T09:32:55.640537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"cited_work":{"arxiv_id":"2511.04805","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.04805","snapshot_observed_at":"2026-07-07T04:17:56.460609Z","title":null,"venue":null,"work_id":"82a73e0e-67f4-42ba-8654-ff18ad246cb3","year":2025},"citing_paper":{"arxiv_id":"2605.28207","last_updated":"2026-06-06T13:23:43Z","snapshot_observed_at":"2026-07-06T23:37:50.157617Z","submitted_at":"2026-05-27T09:27:36Z","title":"Pruning and Distilling Mixture-of-Experts into Dense Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-29T12:39:25.535897Z"},"links":{"cited_paper":"/paper/2511.04805","citing_paper":"/paper/2605.28207"},"observation_digest":"sha256:2482d21442d4c25cb05b5b8b47ebf7d99927fe7ca06c0a03868742a61c8e0807","observation_id":"046135be-7fb7-4b0c-bec4-6263e30c6054","resolution":{"observed_at":"2026-07-07T04:17:56.460609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04805","snapshot_observed_at":"2026-08-06T23:51:34.294269Z","title":"2511.04805 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04454","last_updated":"2026-08-05T05:09:20Z","snapshot_observed_at":"2026-08-09T05:23:13.316163Z","submitted_at":"2026-08-05T05:09:20Z","title":"Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:51:34.294269Z"},"links":{"cited_paper":"/paper/2511.04805","citing_paper":"/paper/2608.04454"},"observation_digest":"sha256:fae5be4f520de549ce85748958c10a0e84bbf84ab9fe16c67b3b20acf43b1e19","observation_id":"98ebed38-9329-46d0-b19d-3d444bf03a0f","resolution":{"observed_at":"2026-08-06T23:51:34.294269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.04805/citation-record","integrity":"/paper/2511.04805/integrity","json":"/paper/2511.04805/citation-record.json","paper":"/paper/2511.04805"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-03T23:41:52.834106Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.834106Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:44c85914288d308fdcb3d5ff1adf279131065d214cc69f830196597b923eddde","observation_id":"01d8d632-0f50-416c-a227-1bb7d1a31f30","resolution":{"observed_at":"2026-08-03T23:41:52.834106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.837795Z","title":"Retraining-free merging of sparse moe via hierarchical clustering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.837795Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:15e361dd0986c01163f4f83ea6fca6f895da086aa7010c0f3f5015f157fc9d74","observation_id":"08b778f4-0e17-4462-a0bc-d74535b28087","resolution":{"observed_at":"2026-08-03T23:41:52.837795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-03T23:41:52.840823Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.840823Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:f945bf6d932d25009530bbda71ae0f136057988be7298c34575c5bccd6709a02","observation_id":"991a0df8-9dd3-4937-bcc5-32c20e3974ef","resolution":{"observed_at":"2026-08-03T23:41:52.840823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T23:41:52.843975Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.843975Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:2273a3c6dad254bc663854938c3f456cb3b8c82365efdc1db50924c0d266f3f4","observation_id":"045acc1c-6900-406b-a9f8-8b148b8ae78c","resolution":{"observed_at":"2026-08-03T23:41:52.843975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-03T23:41:52.847092Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.847092Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:ab30b34b5106e88c1a889e66382bbf1f9ec9b65dfd59cb18660b1a7f8175d9ab","observation_id":"90d95ac3-731f-4fa0-908f-8216daf7813a","resolution":{"observed_at":"2026-08-03T23:41:52.847092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05799","last_updated":"2025-05-09T05:32:21Z","snapshot_observed_at":"2026-08-07T15:48:34.064844Z","submitted_at":"2025-05-09T05:32:21Z","title":"MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05799","snapshot_observed_at":"2026-08-03T23:41:52.850528Z","title":"Mxmoe: Mixed-precision quantization for moe with accuracy and performance co-design, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.850528Z"},"links":{"cited_paper":"/paper/2505.05799","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:bf20e0258e7586513da24dfdb890735562a00af914a20140bf26aca98498452c","observation_id":"a1e71420-08dd-4415-bec4-d6d31c269da7","resolution":{"observed_at":"2026-08-03T23:41:52.850528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-03T23:41:52.853842Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.853842Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:0f568ef00dde4d30d9edd52223538a110f21a3b042738bb0e241bdba75e155e5","observation_id":"d306b013-b76d-4eef-89b4-564c7cad30cc","resolution":{"observed_at":"2026-08-03T23:41:52.853842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17298","last_updated":"2025-02-24T16:32:22Z","snapshot_observed_at":"2026-08-08T13:22:53.954491Z","submitted_at":"2025-02-24T16:32:22Z","title":"Delta Decompression for MoE-based LLMs Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17298","snapshot_observed_at":"2026-08-03T23:41:52.856931Z","title":"Delta decompression for moe-based llms compression, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.856931Z"},"links":{"cited_paper":"/paper/2502.17298","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:e58fac1558420381e6faa6babaa16ffae70c7843a8e8ce6b306da0323e935b4c","observation_id":"a02cae48-d646-42a7-943f-7854944a495e","resolution":{"observed_at":"2026-08-03T23:41:52.856931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02500","last_updated":"2025-03-17T14:18:42Z","snapshot_observed_at":"2026-08-08T22:25:26.257606Z","submitted_at":"2024-06-04T17:18:40Z","title":"Towards Efficient Mixture of Experts: A Holistic Study of Compression Techniques","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02500","snapshot_observed_at":"2026-08-03T23:41:52.860011Z","title":"Towards efficient mixture of experts: A holistic study of compression techniques, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.860011Z"},"links":{"cited_paper":"/paper/2406.02500","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:e8285e194959e191521460f4c790ec0ede02d7c11dae8a932c3e2e6da9797204","observation_id":"00087d0a-f498-4b2b-8434-ae3b5b9bc33d","resolution":{"observed_at":"2026-08-03T23:41:52.860011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13656","last_updated":"2025-01-07T03:37:12Z","snapshot_observed_at":"2026-08-09T04:54:14.294842Z","submitted_at":"2024-08-24T19:14:02Z","title":"Localize-and-Stitch: Efficient Model Merging via Sparse Task Arithmetic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13656","snapshot_observed_at":"2026-08-03T23:41:52.862989Z","title":"Localize-and-stitch: Efficient model merging via sparse task arithmetic, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.862989Z"},"links":{"cited_paper":"/paper/2408.13656","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:d3daab506dd844c014210fb419bf52e976d7e97f6af3ab1f6ab29e938e1e90f9","observation_id":"7f8a18a1-2ca8-4822-a646-55e5456bf810","resolution":{"observed_at":"2026-08-03T23:41:52.862989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-03T23:41:52.865923Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.865923Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:05ee279914e3da7e904186859818e110f29a14bee5a2080c453069703d576e8d","observation_id":"6576e63a-5b29-4b7a-b325-5a756d272590","resolution":{"observed_at":"2026-08-03T23:41:52.865923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03804","last_updated":"2025-05-02T08:51:55Z","snapshot_observed_at":"2026-08-07T15:57:08.477835Z","submitted_at":"2025-05-02T08:51:55Z","title":"MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03804","snapshot_observed_at":"2026-08-03T23:41:52.868779Z","title":"Moequant: Enhancing quantization for mixture-of-experts large language models via expert-balanced sampling and affinity guidance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.868779Z"},"links":{"cited_paper":"/paper/2505.03804","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:cf59e66da1a0a94554f07cbcf5e1b94f2ec99ded6fc5a2a409bb891ba1577114","observation_id":"8a063dfd-ee8a-45a6-869c-13db3188df59","resolution":{"observed_at":"2026-08-03T23:41:52.868779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02658","last_updated":"2025-04-07T17:09:26Z","snapshot_observed_at":"2026-08-07T16:11:16.987241Z","submitted_at":"2025-04-03T14:54:17Z","title":"MiLo: Efficient Quantized MoE Inference with Mixture of Low-Rank Compensators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02658","snapshot_observed_at":"2026-08-03T23:41:52.871652Z","title":"Milo: Efficient quantized moe inference with mixture of low-rank compensators, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.871652Z"},"links":{"cited_paper":"/paper/2504.02658","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:293b83b6c4840115710528719f4476f718464b7a1e02bac7452bb2edfa1648c6","observation_id":"ee6e218f-ac0d-4a91-ad32-5c40fc7a4fff","resolution":{"observed_at":"2026-08-03T23:41:52.871652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-03T23:41:52.874759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.874759Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:59fd0d5fa62b64b81e19e581b6412e27a141746104a8b7ad45cd066bb0719ac0","observation_id":"9ca93892-cceb-4536-a2cb-23743e9981af","resolution":{"observed_at":"2026-08-03T23:41:52.874759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-03T23:41:52.877669Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.877669Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:bf8e84c1fef1a6635e8e01e329b365ef140c908862208f2be23c9bc6f128e1b4","observation_id":"5345532e-07ac-4710-acc3-c0145d49c1b6","resolution":{"observed_at":"2026-08-03T23:41:52.877669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.880459Z","title":"Compressed sparse tiles for memory-efficient unstructured and semi-structured sparsity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.880459Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:0c6058b279afb3d65138a525e73336399f1f99e0a5e5ae8ab363dff3b0e83069","observation_id":"1f19fcee-eeb6-46a2-9a2f-59a5a0f17840","resolution":{"observed_at":"2026-08-03T23:41:52.880459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.883263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.883263Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:c3a9541ffb559dc77bb830aa6e6ed7d305bd998098466b92da0ebf9f5fa1e427","observation_id":"d8d09d90-56db-404f-952d-062cf6df0437","resolution":{"observed_at":"2026-08-03T23:41:52.883263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06211","last_updated":"2025-07-21T09:16:12Z","snapshot_observed_at":"2026-07-06T19:12:57.997252Z","submitted_at":"2024-09-10T04:34:42Z","title":"STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06211","snapshot_observed_at":"2026-08-03T23:41:52.885793Z","title":"Stun: Structured-then-unstructured pruning for scalable moe pruning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.885793Z"},"links":{"cited_paper":"/paper/2409.06211","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:393a93ffaa53257ad4441ca36c54e95ba9da72267ccdb910e96b1992254d202f","observation_id":"e5a99e4a-4446-4a66-978b-cd849d8a7891","resolution":{"observed_at":"2026-08-03T23:41:52.885793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23266","last_updated":"2025-06-29T14:43:50Z","snapshot_observed_at":"2026-08-09T00:48:35.015494Z","submitted_at":"2025-06-29T14:43:50Z","title":"Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23266","snapshot_observed_at":"2026-08-03T23:41:52.889236Z","title":"Sub-moe: Efficient mixture-of-expert llms compression via subspace expert merging, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.889236Z"},"links":{"cited_paper":"/paper/2506.23266","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:23ffba494a422a8938a4c8438e493bc5f1851c5ad29b8c26c798138667565e35","observation_id":"aa53dd31-ba35-43bd-a312-d9718e0365cf","resolution":{"observed_at":"2026-08-03T23:41:52.889236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01334","last_updated":"2024-03-14T11:01:15Z","snapshot_observed_at":"2026-08-07T20:30:45.667420Z","submitted_at":"2023-10-02T16:51:32Z","title":"Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01334","snapshot_observed_at":"2026-08-03T23:41:52.892552Z","title":"Merge, then compress: Demystify efficient smoe with hints from its routing policy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.892552Z"},"links":{"cited_paper":"/paper/2310.01334","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:1e9fd1a9be7b546da2c54056427ebee8506222d304803ef4bd6a1cd16d45ad51","observation_id":"d48c4271-7f56-4a8e-b8f5-47e105aec39a","resolution":{"observed_at":"2026-08-03T23:41:52.892552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-03T23:41:52.895649Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.895649Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:fb1c16f1f17d9d6d28f3c774016ec371efd6c11adbe59e5ddbefd69e70cec368","observation_id":"b5df031a-ec70-4ec2-b6c7-fb95b160fc42","resolution":{"observed_at":"2026-08-03T23:41:52.895649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14800","last_updated":"2024-05-30T16:24:16Z","snapshot_observed_at":"2026-08-09T05:34:20.536320Z","submitted_at":"2024-02-22T18:56:07Z","title":"Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14800","snapshot_observed_at":"2026-08-03T23:41:52.898841Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.898841Z"},"links":{"cited_paper":"/paper/2402.14800","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:8a30f4cd3694d7233bda3400eb4278fd19670005b5c5761d7ab6692268380559","observation_id":"1cd25960-a6da-476c-8de5-adbda4992407","resolution":{"observed_at":"2026-08-03T23:41:52.898841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.902228Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.902228Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:06360b5de2a470138a798cf6e41c128058f2f91ff7a732638844f7143f4c3e0b","observation_id":"da4f4a16-d4d7-4b78-845a-cd58e8b87437","resolution":{"observed_at":"2026-08-03T23:41:52.902228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.905552Z","title":"Ronald Miller","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.905552Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:441afeaca7d649cc12dffa6761fab9b603a15dffe257a4b7c697082a3cff394f","observation_id":"025e935a-b34d-42c3-8a2b-1a75f9a5c104","resolution":{"observed_at":"2026-08-03T23:41:52.905552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-03T23:41:52.908779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.908779Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:63a449d24c3b8503bda9e627d6169ba099448e3e65087c22d5724037fba36ec6","observation_id":"3fe2b623-33f9-4e78-96a5-feb718932f01","resolution":{"observed_at":"2026-08-03T23:41:52.908779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-03T23:41:52.911960Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.911960Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:4eab4b84aecc06d40b35107e8e9cfeea1c95d028becd465baee13ea4ccc27d8f","observation_id":"acdb41fb-8c1e-448f-beb2-a547391a88cb","resolution":{"observed_at":"2026-08-03T23:41:52.911960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13429","last_updated":"2024-02-20T23:45:37Z","snapshot_observed_at":"2026-08-09T16:57:33.613190Z","submitted_at":"2024-02-20T23:45:37Z","title":"Everything You Always Wanted to Know About Storage Compressibility of Pre-Trained ML Models but Were Afraid to Ask","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13429","snapshot_observed_at":"2026-08-03T23:41:52.915255Z","title":"Everything you always wanted to know about storage compressibility of pre-trained ml models but were afraid to ask, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.915255Z"},"links":{"cited_paper":"/paper/2402.13429","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:d3c521b4b1508e46e4fc28c1b37ae4df277d7802df943358676be057918338c0","observation_id":"8a676dbe-75d5-4327-b584-e9c86751f416","resolution":{"observed_at":"2026-08-03T23:41:52.915255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-03T23:41:52.918257Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.918257Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:9c0e8030225d2873a481d55de964c7da87a7a1ebf90321454a13f17c2c7a2c6c","observation_id":"8b98c728-1004-4379-a87a-1534c1aad3cb","resolution":{"observed_at":"2026-08-03T23:41:52.918257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.921149Z","title":"Qwen1.5-moe: Matching 7b model performance with 1/3 activated parameters\", February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.921149Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:0fac79b16c7afad00b506a87914ff394134a1ff77e5d79d7439c0ca226744f22","observation_id":"0b123788-4dea-4741-9699-a2a1fcd7b1fb","resolution":{"observed_at":"2026-08-03T23:41:52.921149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T23:41:52.924296Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.924296Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:b8c8dfb80cb5bc92cd128c7ef9356d6de6e9b6908d1ddec506044fa418500404","observation_id":"011be3d4-145b-4233-99e7-dfedbfc066f5","resolution":{"observed_at":"2026-08-03T23:41:52.924296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01016","last_updated":"2024-11-01T20:37:58Z","snapshot_observed_at":"2026-07-06T19:43:55.074449Z","submitted_at":"2024-11-01T20:37:58Z","title":"MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01016","snapshot_observed_at":"2026-08-03T23:41:52.927468Z","title":"Moe-i ^2 : Compressing mixture of experts models through inter-expert pruning and intra-expert low-rank decomposition, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.927468Z"},"links":{"cited_paper":"/paper/2411.01016","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:8801d95d4de4209c30045f304c11ef49b24e731e40f285a7d034dec8701fda51","observation_id":"c986254d-4e84-45a7-81e5-e58639686ea9","resolution":{"observed_at":"2026-08-03T23:41:52.927468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-03T23:41:52.930376Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.930376Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:e0e5ef7c97106e420e8ce83713a7f4105783db0996c5a90565acfff1f55a853e","observation_id":"926af6f5-b454-492f-bdc7-4c4613c6064b","resolution":{"observed_at":"2026-08-03T23:41:52.930376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-03T23:41:52.933402Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.933402Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:3f2e7ae782faa93542a98f7e08c5f47b0b3fcfcbbbf35d501a9773ec4521cea9","observation_id":"021d6ffe-eb1a-4971-a46c-8aa30a6331d9","resolution":{"observed_at":"2026-08-03T23:41:52.933402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.936512Z","title":"70 URL https://arxiv.org/abs/2504.11651","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.936512Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:93aa68b2705aba0a1bd01348e4f8848a5e546de82ba75be61150e1778706ffe7","observation_id":"c332b9a1-ca43-443a-bc6a-f37421567945","resolution":{"observed_at":"2026-08-03T23:41:52.936512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17380","last_updated":"2025-07-08T01:55:33Z","snapshot_observed_at":"2026-08-08T23:30:57.781594Z","submitted_at":"2025-02-24T18:06:57Z","title":"Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17380","snapshot_observed_at":"2026-08-03T23:41:52.939720Z","title":"Low-rank and sparse model merging for multi-lingual speech recognition and translation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.939720Z"},"links":{"cited_paper":"/paper/2502.17380","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:040a1a63ed71e830d4a8457b41e51c8c78e9bc4a23c348c37c13c0129a2f4978","observation_id":"35a97476-723d-43b8-bf54-07c85b7fceb1","resolution":{"observed_at":"2026-08-03T23:41:52.939720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.942847Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.942847Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:06eeb5d6c94270722645b5a952ccb04af14ee54f0e28946b255dc4a4e37c97ba","observation_id":"3de22f6b-4fb0-432a-9842-f726d01d94dd","resolution":{"observed_at":"2026-08-03T23:41:52.942847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.946582Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.946582Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:b2e55d97497356b94d3899452233a353953a5728c3df72bd546a16f45770173d","observation_id":"d3cbb099-45b1-45f8-a50e-aff714f8f1d8","resolution":{"observed_at":"2026-08-03T23:41:52.946582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.949651Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.949651Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:0cb4d265c9e58d0613f1531d069956c1493c81a5ffd01ad212312ea91d1927e6","observation_id":"0ece3df0-42ae-408b-bd84-f23684b18c69","resolution":{"observed_at":"2026-08-03T23:41:52.949651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:41:52.952675Z","title":"However, their widespread deployment remains limited due to the high memory overhead associated with storing all expert parameters, particularly as the number of experts increases","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.952675Z"},"links":{"citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:6b0779544e56758f5d854a9e7e018e65feafa5ab19fea42f602b33f59ae6ae9d","observation_id":"4c352232-09da-40ee-a84f-2162e5063b0b","resolution":{"observed_at":"2026-08-03T23:41:52.952675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2511.04805."}