{"as_of":"2026-08-19T21:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:994cdf6e4cb8a4b29f769d7a919b7b06c4982e7e582c76fee33b2bd6174bebfe","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:53:31.121991Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:16:13.946445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:19:54.305666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"cited_work":{"arxiv_id":"2508.19373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19373","snapshot_observed_at":"2026-07-04T14:19:54.305666Z","title":null,"venue":null,"work_id":"05a713f3-823f-40f1-bac9-37755ed48247","year":2025},"citing_paper":{"arxiv_id":"2606.26607","last_updated":"2026-06-25T05:10:20Z","snapshot_observed_at":"2026-08-08T13:05:18.203440Z","submitted_at":"2026-06-25T05:10:20Z","title":"Moebius: Serving Mixture-of-Expert Models with Seamless Runtime Parallelism Switch","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T04:06:13.426379Z"},"links":{"cited_paper":"/paper/2508.19373","citing_paper":"/paper/2606.26607"},"observation_digest":"sha256:090550a604edac5257b41c24a11860bf12aaa9810082c79f563c7a03cc2ccc4b","observation_id":"605ca0d3-c892-4868-8dad-b1eab5e2fa33","resolution":{"observed_at":"2026-07-04T14:19:54.307203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19373","snapshot_observed_at":"2026-08-07T19:16:13.946445Z","title":"Hap: Hybrid adaptive parallelism for efficient mixture-of-experts inference.arXiv preprint arXiv:2508.19373,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06025","last_updated":"2026-08-06T13:31:09Z","snapshot_observed_at":"2026-08-11T16:32:05.463809Z","submitted_at":"2026-08-06T13:31:09Z","title":"Hybrid-Adaptive Thread Tuning to Mitigate Simulation Execution Bottlenecks in High-Performance Reinforcement Learning Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T19:16:13.946445Z"},"links":{"cited_paper":"/paper/2508.19373","citing_paper":"/paper/2608.06025"},"observation_digest":"sha256:dcba13a1ed5cc7f63c108e8df0c47f2e125a1bbfe5777836cd9b72b97d9c0490","observation_id":"658b5d45-7a36-4a0d-8404-f8307c332c67","resolution":{"observed_at":"2026-08-07T19:16:13.946445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19373/citation-record","integrity":"/paper/2508.19373/integrity","json":"/paper/2508.19373/citation-record.json","paper":"/paper/2508.19373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-17T06:02:42.650883Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-05T15:53:28.504969Z","title":"Efficient large scale language modeling with mixtures of experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.504969Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:a0d73723f790e1707413209ae240639e5d10e03a9304fe73bc1861362555c695","observation_id":"78aa2a76-a5c6-4126-907b-2a602040a306","resolution":{"observed_at":"2026-08-05T15:53:28.504969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-05T15:53:28.577800Z","title":"No language left behind: Scaling human-centered machine translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.577800Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:4c65ec92685d27d5637111c98ca9ddc6f7139b412da490445c9161405b6b0be1","observation_id":"8df2bef5-66bd-425c-944c-7d07216a5636","resolution":{"observed_at":"2026-08-05T15:53:28.577800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:28.650393Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.650393Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:6724b01348ee10d7a049bcaf074147b2266a66d58c263d68a9fd7d10d7f39d15","observation_id":"a84a559f-a641-4df7-897c-a4e92ed5c209","resolution":{"observed_at":"2026-08-05T15:53:28.650393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T15:53:28.788647Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.788647Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:5a7acbc96fcac4bf8047f61707a124839f8b8f031776335d57160dc0c79d4a2a","observation_id":"2840d992-add2-4378-bd70-3d352bdd3536","resolution":{"observed_at":"2026-08-05T15:53:28.788647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:35.385154Z","title":"Scaling vision with sparse mixture of experts,","venue":null,"work_id":"a9cd9bf5-22bc-41f1-bc2b-644903b7f223","year":2021},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.889836Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:fb24e60292900e85dbbad34a85f884642c5391a7e2843578d819eb72c0779ef8","observation_id":"de6209a7-9317-4477-ae13-1488bb143802","resolution":{"observed_at":"2026-08-05T15:53:35.471837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:35.026862Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":"310686ac-db53-4f6c-adc0-8115a6fe9736","year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.944744Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:b4426c1eb3ff8332b448235abd17515c5ba60604cd4454d178eacd9fe6ec0a6f","observation_id":"1fe8b34c-17fa-42fa-bd32-2838f16b6e75","resolution":{"observed_at":"2026-08-05T15:53:35.213876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-08-16T14:47:07.109022Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-05T15:53:29.009532Z","title":"Deepspeed- fastgen: High-throughput text generation for llms via mii and deepspeed- inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.009532Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:4fa9cbb7022e650b4231a449798f21dc7b2399cfda1a46004116bcba51ce2fce","observation_id":"804a2c0c-1dc3-47dc-a9f9-82497e7d3e21","resolution":{"observed_at":"2026-08-05T15:53:29.009532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.773241Z","title":"Moesys: A distributed and efficient mixture-of-experts training and inference system for internet services,","venue":null,"work_id":"26c33ef4-cc6c-46c1-9d83-05b04cfe444d","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.122972Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:54acb7b09118466d10eda852e42c99bd40587baea906994f085c41c0a290075e","observation_id":"2267c1e9-1983-472e-a626-811df387e571","resolution":{"observed_at":"2026-08-05T15:53:34.893015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T15:53:29.246910Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.246910Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:1814f941c84a2e205f5d88ed6b50e0bad71c1f7ff4f3cd1e04e7a869bfc94a9c","observation_id":"d9a93d69-9e96-4857-b601-668103d04040","resolution":{"observed_at":"2026-08-05T15:53:29.246910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T15:53:29.303551Z","title":"Designing effective sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.303551Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:f2297741b823cfb2c4e5899ec015739a7b02d5b404c1cd972bde81907e2b2856","observation_id":"0891a351-fee2-4949-8b0e-eadd58e3fc64","resolution":{"observed_at":"2026-08-05T15:53:29.303551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T15:53:29.456526Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.456526Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:fd9acaf7f7e8ea24d7ac0a591467f7f6cbb96dd38f54b8b86460bdb0988a8cc0","observation_id":"32bea133-c8ac-4fac-88ad-5fcaa90b9656","resolution":{"observed_at":"2026-08-05T15:53:29.456526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.522396Z","title":"Qwen1.5-moe: Matching 7b model performance with 1/3 activated parameters","venue":null,"work_id":"601bb141-9699-4a6c-9594-54797efa636d","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.581788Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:7ad483031312b0612da46982289c186a39db6b7be1e3b7a10d9fc14c0bc3702b","observation_id":"67d1fffb-a61a-40c8-a54d-fda1aebfd43b","resolution":{"observed_at":"2026-08-05T15:53:34.649050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.246734Z","title":"Qwen2 technical report,","venue":null,"work_id":"b41324ec-facf-4e02-ae1b-60e08eb148d4","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.683861Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:49597ffba55f06d32dcbe0878ab7e46d5fdb368e6c7d6f77c876393ec32158a6","observation_id":"b4145053-23c4-4042-9b99-8e4fbb40d428","resolution":{"observed_at":"2026-08-05T15:53:34.383939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.056989Z","title":"A tensorrt toolbox for optimized large language model inference","venue":null,"work_id":"eaad90da-2093-41c1-a9d0-740ad380da22","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.789935Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:05726a843698e3dcbf466bcf687691092528446874b001cbe4a87991a277b1f5","observation_id":"bebc2fe6-f70e-47f9-b054-42ebf961b062","resolution":{"observed_at":"2026-08-05T15:53:34.150158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:33.746135Z","title":"Sglang: Efficient execution of structured language model programs,","venue":null,"work_id":"27d47165-2cb5-4f09-99b0-c8eea27df15c","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.885147Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:a2aeb3f9154dae274c329c7da57a482d4ce99f719a50bb178b4c9edf29cc18ee","observation_id":"7defcc0e-ab5d-4898-bf95-3bc49fd3b840","resolution":{"observed_at":"2026-08-05T15:53:33.863906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04964","last_updated":"2024-12-11T13:27:00Z","snapshot_observed_at":"2026-08-18T12:58:44.217063Z","submitted_at":"2024-12-06T11:29:32Z","title":"Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04964","snapshot_observed_at":"2026-08-05T15:53:29.967927Z","title":"Flash communication: Reducing tensor parallelization bottleneck for fast large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.967927Z"},"links":{"cited_paper":"/paper/2412.04964","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:e3d6fc77bea43312ff28cdbaaf00bbb0f88939c1a9f5a83912f2f8ff2403ad87","observation_id":"8a2df785-e639-439d-b2dd-6cafd657326f","resolution":{"observed_at":"2026-08-05T15:53:29.967927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06182","last_updated":"2023-06-18T01:33:19Z","snapshot_observed_at":"2026-08-16T15:49:08.096879Z","submitted_at":"2023-03-10T19:30:15Z","title":"Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06182","snapshot_observed_at":"2026-08-05T15:53:30.143109Z","title":"Towards moe deployment: Mitigating inefficiencies in mixture-of-expert (moe) inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.143109Z"},"links":{"cited_paper":"/paper/2303.06182","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:84a7952eb9ee16c4d38131924012ef2d599489564587f30ed33f3ec9beee3234","observation_id":"bf46c29f-504f-411e-800f-c48a25a3b836","resolution":{"observed_at":"2026-08-05T15:53:30.143109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:33.407062Z","title":"Deepspeed-moe: Advancing mixture- of-experts inference and training to power next-generation ai scale,","venue":null,"work_id":"bada6bb4-f606-4cb4-89e7-bc66cd477cbe","year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.284288Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:58113ac39a3cd4b3652c5118925eb9626b7e1d1016194cf40a299f9ba341b285","observation_id":"10fe3b85-88c6-4681-9a38-de8394dae73e","resolution":{"observed_at":"2026-08-05T15:53:33.554501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:33.145261Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture- of-experts training,","venue":null,"work_id":"6c0551d3-b3de-477e-9c1d-0258cc56d154","year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.429204Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:93b764abb856cb635e539896a9a7ef5e27a024226ab51c4554fb62b66df926ee","observation_id":"80bbc26a-33c2-4fec-9cf4-ddeb9c3bd5f6","resolution":{"observed_at":"2026-08-05T15:53:33.247641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.802939Z","title":"Deepep: an efficient expert-parallel communication library","venue":null,"work_id":"79542eb4-bce9-44e3-bc58-b20dad040af5","year":2025},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.553332Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:b4393523ec8481d1af7d86594ba47b1995f82f9a127d2fe97cd77da461efb5f9","observation_id":"d4006313-5169-4be0-93d9-b7a563c8e2de","resolution":{"observed_at":"2026-08-05T15:53:32.922786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.571679Z","title":"Alpa: Automating inter-and {Intra- Operator} parallelism for distributed deep learning,","venue":null,"work_id":"9aed9dd4-57e9-487a-a92d-b8d9f5b7cc77","year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.716371Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:756878790af867de703b31783cb306608dd5ae2fa68a1fcc41016d48b1dff287","observation_id":"abc71dfc-ed1b-48f9-8d2e-e53006875e2d","resolution":{"observed_at":"2026-08-05T15:53:32.709061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.325518Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":"a37211eb-3839-4798-b8b2-3aca19da4187","year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.782234Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:9a2c6283876e350f94a3f85ca8d2a0849e96a405727c2f10f9fc4458ad4fbe54","observation_id":"c9593ac8-d628-4788-b72f-54a186ca65ff","resolution":{"observed_at":"2026-08-05T15:53:32.422585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.054964Z","title":"Pcie gen-5 design challenges of high-speed servers,","venue":null,"work_id":"d1383149-6380-4f1d-a384-1b144cb9224c","year":2020},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.865671Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:9d9acd054bdf7dd5a2a68fed9d8e79347341f353e64fc029e9c7baa6a3ee546a","observation_id":"3184221e-1e66-418f-8983-9e307435cec1","resolution":{"observed_at":"2026-08-05T15:53:32.187333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:31.773234Z","title":"Nvidia a100 gpu: Performance & innova- tion for gpu computing,","venue":null,"work_id":"3e0aff92-e3c9-4e27-b2cc-597671332df2","year":2020},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.959463Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:beacbe7ec8d21771e046beae7f06277d0f7cb4e25c1ec0ab9a8a474f4fbace12","observation_id":"1bc0417a-b19b-4dc5-a8fc-f6eb5be375ca","resolution":{"observed_at":"2026-08-05T15:53:31.855990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:31.529533Z","title":"Bitsandbytes: a lightweight python wrapper around cuda custom func- tions","venue":null,"work_id":"f1a1037a-50b1-4115-aaff-c85959f24881","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:31.050897Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:80d95056439952c409e4024933bd055a722e83aa9aee278451dcc88c62cd730a","observation_id":"e15fa19d-f1e5-42fe-8275-28e067506fe9","resolution":{"observed_at":"2026-08-05T15:53:31.652787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08295","last_updated":"2021-06-15T17:12:42Z","snapshot_observed_at":"2026-08-19T05:42:08.537901Z","submitted_at":"2021-06-15T17:12:42Z","title":"A White Paper on Neural Network Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08295","snapshot_observed_at":"2026-08-05T15:53:31.121991Z","title":"A white paper on neural network quantization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:31.121991Z"},"links":{"cited_paper":"/paper/2106.08295","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:2f5fea9b91ee416fb0c0861208b8907d168cd9b698c022d83237adddc7965e5b","observation_id":"ddd5ed51-d969-4652-bf2e-66513c54a65a","resolution":{"observed_at":"2026-08-05T15:53:31.121991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-14T11:18:24.908809Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2508.19373."}