{"as_of":"2026-08-10T04:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c794866d2916c846bf74622c64cbb6328d9e13827d26674dded9bdbf1709f4c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:32:47.917300Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.19938/citation-record","integrity":"/paper/2602.19938/integrity","json":"/paper/2602.19938/citation-record.json","paper":"/paper/2602.19938"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1711.05136","last_updated":"2018-08-07T18:12:10Z","snapshot_observed_at":"2026-08-02T08:20:39.795411Z","submitted_at":"2017-11-14T15:02:47Z","title":"Deep Rewiring: Training very sparse deep networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05136","snapshot_observed_at":"2026-08-02T21:32:44.948013Z","title":"Deep rewiring: Training very sparse deep networks.arXiv preprint arXiv:1711.05136,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:44.948013Z"},"links":{"cited_paper":"/paper/1711.05136","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:9c1077aa613e2507dbedf0cc1c913ad285623802bfadd19539620ebd68be2664","observation_id":"c5649613-9af0-490d-aee7-85a81c5d09e0","resolution":{"observed_at":"2026-08-02T21:32:44.948013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-02T21:32:45.301159Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks.arXiv preprint arXiv:1803.03635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.301159Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:60a2d95f4b6cfb4f87db1996b8bea1d9d4bc6282e488b44aa3c7f35f636c48dc","observation_id":"26f304c9-6c42-4ac7-8b60-0fc3bfc08edf","resolution":{"observed_at":"2026-08-02T21:32:45.301159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06182","last_updated":"2023-06-18T01:33:19Z","snapshot_observed_at":"2026-07-06T15:01:30.019542Z","submitted_at":"2023-03-10T19:30:15Z","title":"Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06182","snapshot_observed_at":"2026-08-02T21:32:45.535224Z","title":"Lee, Anjali Sridhar, Shruti Bhosale, Carole-Jean Wu, and Benjamin Lee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.535224Z"},"links":{"cited_paper":"/paper/2303.06182","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:b7b7efcc3758dbdd7ac6ff24faffecd63e236d45ee01c9791fbfa9eb04ce8136","observation_id":"3fba3b89-ab0e-4b0e-a054-683de3c8271a","resolution":{"observed_at":"2026-08-02T21:32:45.535224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05398","last_updated":"2023-03-04T04:43:49Z","snapshot_observed_at":"2026-08-09T20:47:04.856732Z","submitted_at":"2023-03-04T04:43:49Z","title":"MathPrompter: Mathematical Reasoning using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05398","snapshot_observed_at":"2026-08-02T21:32:45.586588Z","title":"Pre-gated moe: An algorithm-system co-design for fast and scalable mixture-of-expert inference, 2024.https://arxiv.org/abs/2308","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.586588Z"},"links":{"cited_paper":"/paper/2303.05398","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:fb1cab2a7efcbc47dbb2510601d31adcb9a8045d85a5d61e404e18310fe22dcd","observation_id":"be9d72b0-5d09-4624-a639-712d70c7d671","resolution":{"observed_at":"2026-08-02T21:32:45.586588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T21:32:45.815295Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.815295Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:49bbc81bcf9200e4ca99081a84b60e54889ba7c3880cb03d528385bd81dd784b","observation_id":"a16666b4-85b6-4f95-8b37-244edddc5327","resolution":{"observed_at":"2026-08-02T21:32:45.815295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15030","last_updated":"2024-05-29T08:25:03Z","snapshot_observed_at":"2026-08-06T12:44:13.816721Z","submitted_at":"2023-08-29T05:25:21Z","title":"SwapMoE: Serving Off-the-shelf MoE-based Large Language Models with Tunable Memory Budget","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15030","snapshot_observed_at":"2026-08-02T21:32:45.891720Z","title":"Raghuraman Krishnamoorthi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.891720Z"},"links":{"cited_paper":"/paper/2308.15030","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:3f472d41188c30f210524f03e591bb4c2b6ad04d47d4b434be799edd08f5593e","observation_id":"bf7cb693-3216-476d-aae0-c18d55c558fc","resolution":{"observed_at":"2026-08-02T21:32:45.891720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-02T21:32:45.963798Z","title":"Scaling giant models with conditional computation and automatic sharding.arXiv preprint arXiv:2006.16668, 2020a","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.963798Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:a0d2afd8f4a9b4a8e3890c59e6a4b9db2dae35bd18d70cdc056724a5250852a6","observation_id":"17699da9-e3dd-44f2-b44e-2c75b053d9d0","resolution":{"observed_at":"2026-08-02T21:32:45.963798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-02T21:32:46.028389Z","title":"19 Haiquan Lu, Yefan Zhou, Shiwei Liu, Zhangyang Wang, Michael W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.028389Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:5a7294513a46da27efd1cdd23b83631146c00af5dabb037c65b6cfaf860331df","observation_id":"ecd4fd35-43a1-4ae2-ad23-d9c4901028dd","resolution":{"observed_at":"2026-08-02T21:32:46.028389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10912","last_updated":"2024-10-14T03:35:11Z","snapshot_observed_at":"2026-07-06T19:33:21.541657Z","submitted_at":"2024-10-14T03:35:11Z","title":"AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10912","snapshot_observed_at":"2026-08-02T21:32:46.101296Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.101296Z"},"links":{"cited_paper":"/paper/2410.10912","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:acd1d41a9ae033e944b824e9d8b250a2308838e0ae9a682d937300f3bf5594d1","observation_id":"1e87c76d-2f96-4b48-a16d-4167011f5afb","resolution":{"observed_at":"2026-08-02T21:32:46.101296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11627","last_updated":"2023-09-28T03:59:27Z","snapshot_observed_at":"2026-07-06T15:29:39.466936Z","submitted_at":"2023-05-19T12:10:53Z","title":"LLM-Pruner: On the Structural Pruning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11627","snapshot_observed_at":"2026-08-02T21:32:46.231928Z","title":"Stephen Merity, Caiming Xiong, James Bradbury, and Richard Socher","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.231928Z"},"links":{"cited_paper":"/paper/2305.11627","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:2f836a609197b51bffaa926e4dbd72c024e3c52c2f1c0ac696639c36cf57cf5b","observation_id":"9e41dd5c-4aa4-40b2-b200-12d63ee3e27c","resolution":{"observed_at":"2026-08-02T21:32:46.231928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-07T07:29:29.524604Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-02T21:32:46.323377Z","title":"Pruning convolutional neural networks for resource efficient inference.arXiv preprint arXiv:1611.06440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.323377Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:327eb1980836a8937407063720b975a61724fbf392b37c5728add361e40eca7d","observation_id":"7a8a08df-5f80-47b7-9ffc-862559cd3f3f","resolution":{"observed_at":"2026-08-02T21:32:46.323377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:32:46.565024Z","title":"https://aclanthology.org/Q19-1016/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.565024Z"},"links":{"citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:ca914f2e270b5638e3b057bd926abedce71b253f61602035121818436c8f9451","observation_id":"f3ec516e-e2c7-4ccf-849a-da6909f3db15","resolution":{"observed_at":"2026-08-02T21:32:46.565024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16712","last_updated":"2025-08-22T14:59:23Z","snapshot_observed_at":"2026-08-08T03:40:09.561584Z","submitted_at":"2025-08-22T14:59:23Z","title":"Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16712","snapshot_observed_at":"2026-08-02T21:32:46.741030Z","title":"Systematic characterization of llm quantization: A performance, energy, and quality perspective, 2025.https://arxiv.org/abs/2508.16712","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.741030Z"},"links":{"cited_paper":"/paper/2508.16712","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:abce4f45b21293b29ec2eba592681900b453ce2f5286de06784658b3d44d3220","observation_id":"0240ea56-1bcd-4876-9813-92b052dcdf30","resolution":{"observed_at":"2026-08-02T21:32:46.741030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-02T21:32:46.952975Z","title":"Ke Wang, Houxing Ren, Aojun Zhou, Zimu Lu, Sichun Luo, Weikang Shi, Renrui Zhang, Linqi Song, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.952975Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:93e3672040b96205dd56b79a9e1e0764f40ff16e8eb17cddcc2989d16fdc28cc","observation_id":"640d47b3-c827-4530-8609-4c1171b90e33","resolution":{"observed_at":"2026-08-02T21:32:46.952975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-03T02:22:36.564849Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-02T21:32:47.069093Z","title":"Auxiliary-loss-free load balancing strategy for mixture-of-experts, 2024.https://arxiv.org/abs/2408.15664","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.069093Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:b7e88ab9431f3a3d6994888bbfc7e9d17c332c37522006da4640b9e2caf072fd","observation_id":"5747fa34-0ae2-40c9-a46c-b9e4e25a1ec5","resolution":{"observed_at":"2026-08-02T21:32:47.069093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-02T21:32:47.190057Z","title":"doi: 10.18653/v1/D15-1237.https://aclanthology.org/D15-1237/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.190057Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:88675f686359dcf3d0b09934f10437faaedd7ece9100d5b1734bd199d10cfab5","observation_id":"dd601836-1c38-4c44-8c73-b5ac115df73c","resolution":{"observed_at":"2026-08-02T21:32:47.190057Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03044","last_updated":"2017-08-25T13:21:18Z","snapshot_observed_at":"2026-07-06T05:29:31.198406Z","submitted_at":"2017-02-10T02:30:22Z","title":"Incremental Network Quantization: Towards Lossless CNNs with Low-Precision Weights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03044","snapshot_observed_at":"2026-08-02T21:32:47.700690Z","title":"Incremental network quantization: Towards lossless cnns with low-precision weights.arXiv preprint arXiv:1702.03044, 2017a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.700690Z"},"links":{"cited_paper":"/paper/1702.03044","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:937107afea2060e22bfe7bf73d0f78f1993680a636ee112c0643aeb83fb70438","observation_id":"1dab9dbf-2ff2-4733-a74f-14cdf17ce36f","resolution":{"observed_at":"2026-08-02T21:32:47.700690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03904","last_updated":"2023-09-07T17:59:43Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:43Z","title":"Exploring Sparse MoE in GANs for Text-conditioned Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03904","snapshot_observed_at":"2026-08-02T21:32:47.822382Z","title":"Exploring sparse moe in gans for text-conditioned image synthesis.arXiv preprint arXiv:2309.03904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.822382Z"},"links":{"cited_paper":"/paper/2309.03904","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:4e4000abba025518e8acc8fb34438b6c701c9ce606873c25f3127430c0093313","observation_id":"e0bd5800-dffa-442c-b380-5b2bef93cdc7","resolution":{"observed_at":"2026-08-02T21:32:47.822382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-02T21:32:47.917300Z","title":"St-moe: Designing stable and transferable sparse expert models, 2022.https://arxiv.org/abs/2202.08906","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.917300Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:d74ad2978f83118b6f619fb58b57be5441c068513f51d6d386889d1a7c1d7c9c","observation_id":"72bf5afb-77d3-4ae0-af99-d779c209ab0a","resolution":{"observed_at":"2026-08-02T21:32:47.917300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-02T21:32:45.765434Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.765434Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:62dff0ee9f4afb045d9128f967745142a113b51e398aa0113ce36e3e8904114a","observation_id":"a40d2930-fdbf-445b-9d2c-2df26913bf5a","resolution":{"observed_at":"2026-08-02T21:32:45.765434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25041","last_updated":"2026-05-06T06:43:02Z","snapshot_observed_at":"2026-08-03T04:43:05.899007Z","submitted_at":"2025-09-29T16:57:33Z","title":"GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25041","snapshot_observed_at":"2026-08-02T21:32:45.476307Z","title":"Grace-moe: Grouping and replication with locality-aware routing for efficient distributed moe inference, 2025.https://arxiv.org/abs/2509.25041","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.476307Z"},"links":{"cited_paper":"/paper/2509.25041","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:ccfacb3225714589c53d1ad0f387fbd98d54bdf7b263e7ce312713d4dc9f5fdb","observation_id":"6ba0ceff-4272-4239-832b-8fa7681de94f","resolution":{"observed_at":"2026-08-02T21:32:45.476307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-02T21:32:47.576363Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019.https://arxiv.org/abs/1905.07830","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.576363Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:288f474f5a20ee1476139b7e3329715320487fdf200c89e6e8d250f6d675154c","observation_id":"2c82cef0-921c-4e14-b83f-4b266164cd0b","resolution":{"observed_at":"2026-08-02T21:32:47.576363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-02T21:32:45.022568Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019.https://arxiv.org/abs/1911.11641","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.022568Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:c129b69fe432c4fa4fd703653f143e3d8f9ab6aae5428a89c4f13b00ed39d84f","observation_id":"12f5d8b2-ac3f-44c6-8603-a738968efac1","resolution":{"observed_at":"2026-08-02T21:32:45.022568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-02T21:32:45.369082Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023.https://arxiv.org/abs/2210.17323","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.369082Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:be30fbe1d4fc649ff122b435050ca1d4ee99445aac4f9908e0922d227e81b3c1","observation_id":"30dd69dd-16ed-488e-9087-118f33bdf256","resolution":{"observed_at":"2026-08-02T21:32:45.369082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:32:46.495634Z","title":"Load balancing mixture of experts with similarity preserving routers, 2025.https://arxiv.org/abs/2506.14038","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.495634Z"},"links":{"citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:66244fb014df2f09461437baf7bd360fe90f4541b28166ec94f51b2b29a7d363","observation_id":"a13b915e-d7a6-4cbf-8d5e-9333396d095c","resolution":{"observed_at":"2026-08-02T21:32:46.495634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:32:47.342765Z","title":"Sergey Zagoruyko and Nikos Komodakis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.342765Z"},"links":{"citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:4b1219a8a380f7bb94e29b628ea009c0dea76bde0fc0f6e21ce76b658b665b9e","observation_id":"38e2c223-ba81-467f-ae84-d88585e7db20","resolution":{"observed_at":"2026-08-02T21:32:47.342765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-02T21:32:46.661601Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019.https://arxiv.org/abs/1907.10641","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:46.661601Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:46dac481eeda7f1dcb3a287994143197fb6a66a17e1698f40b98f61a1f94dde3","observation_id":"48e7364a-526e-43d0-b9ca-bdd52b718f6d","resolution":{"observed_at":"2026-08-02T21:32:46.661601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-02T21:32:45.108043Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.108043Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:ac20ed978b8cf61732a320d512c9506948cce449cf96716558886d43fe74492b","observation_id":"91ba37c3-0a0d-4940-9a6c-5cc4c030616b","resolution":{"observed_at":"2026-08-02T21:32:45.108043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05877","last_updated":"2017-12-15T23:56:52Z","snapshot_observed_at":"2026-07-06T06:14:38.280461Z","submitted_at":"2017-12-15T23:56:52Z","title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05877","snapshot_observed_at":"2026-08-02T21:32:45.681616Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference, 2017.https://arxiv.org/abs/1712.05877","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.681616Z"},"links":{"cited_paper":"/paper/1712.05877","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:436c411656d9be66c9f5d4a82387c0459a2535d77cc85a4f5687de91f7851e1c","observation_id":"60a34feb-a324-4079-a8c2-30d24acc0b46","resolution":{"observed_at":"2026-08-02T21:32:45.681616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-02T21:32:45.167870Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale, 2022.https://arxiv.org/abs/2208.07339","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.167870Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:c9f8e1bb0fea5a7ff05f14222e1899ffc10e650f8dc7bcc5325e4153d65229f6","observation_id":"aa8540e2-59da-45f2-89cc-8733b036db1e","resolution":{"observed_at":"2026-08-02T21:32:45.167870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:32:45.229607Z","title":"Zachary Doucet, Rishi Sharma, Martijn de Vos, Rafael Pires, Anne-Marie Kermarrec, and Oana Balmau","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:45.229607Z"},"links":{"citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:89d89054b67d31af558e2585bd47db1c238d8df3013e913e15500c438aaa2e4f","observation_id":"f5098165-2ac2-4d9e-aede-d79affeade7e","resolution":{"observed_at":"2026-08-02T21:32:45.229607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T12:44:23.337135Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2602.19938."}