{"as_of":"2026-08-17T00:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5517a862735fbe70e15d11328aef725fa286d9a642be642a107e1e45531fc6a1","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:35:57.253552Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:37:01.570731Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:46:26.849370Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2507.03014","last_updated":"2026-04-24T14:19:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T12:29:38Z","title":"Intrinsic Fingerprint of LLMs: Continue Training is NOT All You Need to Steal A Model!","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T06:39:47.345016Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2507.03014"},"observation_digest":"sha256:c98641010f65d022df79f03755d72b31ca9a282d1da8667a346fa783e3d7fa37","observation_id":"16f35138-4123-4a47-b070-9748ec198a14","resolution":{"observed_at":"2026-05-19T06:42:07.456953Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2604.23996","last_updated":"2026-04-27T03:23:19Z","snapshot_observed_at":"2026-08-15T05:33:19.595727Z","submitted_at":"2026-04-27T03:23:19Z","title":"SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:52.098355Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2604.23996"},"observation_digest":"sha256:29912a41b6fe6c0d4f2d5373bc9c615756521099bc61c9b862268e4148402ea3","observation_id":"f54dbbfc-b90b-41c9-bd9d-93fb20156c8a","resolution":{"observed_at":"2026-05-11T21:36:18.740196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2605.02946","last_updated":"2026-05-01T11:54:55Z","snapshot_observed_at":"2026-08-11T20:13:05.820581Z","submitted_at":"2026-05-01T11:54:55Z","title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:22:00.217729Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2605.02946"},"observation_digest":"sha256:8d02693857391996cbc6d3a3b386c29a93f89dca0bb02ba8a9d0955ffbbae01b","observation_id":"4b7eec21-8fd9-449f-907e-3912a7b79853","resolution":{"observed_at":"2026-05-11T15:46:17.565308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2605.04952","last_updated":"2026-05-06T14:15:10Z","snapshot_observed_at":"2026-08-16T02:18:03.190090Z","submitted_at":"2026-05-06T14:15:10Z","title":"Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-08T17:58:10.323354Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2605.04952"},"observation_digest":"sha256:afdc1aa811c33b02a11bb315e953d4fef9136d5d3156e89dba06d3db5adcca05","observation_id":"6b963ff4-f6f5-4c78-aee5-303e8ec873ff","resolution":{"observed_at":"2026-05-09T06:55:43.442366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2605.08292","last_updated":"2026-05-08T09:21:46Z","snapshot_observed_at":"2026-08-11T11:04:07.495366Z","submitted_at":"2026-05-08T09:21:46Z","title":"Hierarchical Mixture-of-Experts with Two-Stage Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:58:04.218139Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2605.08292"},"observation_digest":"sha256:110ab99dbf9323b82210ff4d03e7995db52f3bc93517ee8c6f4166b4f74a491d","observation_id":"a14ea9f3-6f43-4187-a16d-a652e3b72a0f","resolution":{"observed_at":"2026-05-12T07:46:26.763167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2605.23294","last_updated":"2026-05-22T07:10:57Z","snapshot_observed_at":"2026-08-14T05:24:03.235008Z","submitted_at":"2026-05-22T07:10:57Z","title":"NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T02:57:04.813106Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2605.23294"},"observation_digest":"sha256:870d2f15ae2312531b1c7bd53f11308836e04bcdee6caea02b27dc86995b39e8","observation_id":"96467f3d-5c02-45de-a285-09bf84196d66","resolution":{"observed_at":"2026-05-25T03:00:16.049858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2605.23893","last_updated":"2026-05-22T17:56:13Z","snapshot_observed_at":"2026-08-13T09:48:39.855590Z","submitted_at":"2026-05-22T17:56:13Z","title":"Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T04:33:25.028283Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2605.23893"},"observation_digest":"sha256:4ac30ce9f7283c190b645b1c64a526baddf2c8fd2cd00b98bf40f8159c777c43","observation_id":"d927f8df-9979-4810-9063-888012011b53","resolution":{"observed_at":"2026-05-25T04:35:20.992810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":"2505.21411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-02T01:46:26.849370Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity","venue":null,"work_id":"4d5f658d-4a0f-4912-a8a1-ea34ad08c589","year":2025},"citing_paper":{"arxiv_id":"2606.03465","last_updated":"2026-06-02T10:45:21Z","snapshot_observed_at":"2026-08-12T23:20:29.892505Z","submitted_at":"2026-06-02T10:45:21Z","title":"Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T11:31:25.851340Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2606.03465"},"observation_digest":"sha256:15c9a82d44985209c177146ece0d00d093df42169d53625cef0e506c32cb39ee","observation_id":"da3223b2-ed6c-42bf-8a09-c80adde7a789","resolution":{"observed_at":"2026-07-02T01:46:26.851154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-07-12T02:55:58.459452Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03377","last_updated":"2026-07-03T14:30:22Z","snapshot_observed_at":"2026-08-16T16:46:09.058891Z","submitted_at":"2026-07-03T14:30:22Z","title":"Spectral Signatures of Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T02:55:58.459452Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2607.03377"},"observation_digest":"sha256:771d29adf0b9e1a5865b56a1ed928acc162a528805686eb5baba06314a72b005","observation_id":"809e000c-94c5-48c5-849d-c86782b06bc2","resolution":{"observed_at":"2026-07-12T02:55:58.459452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21411","snapshot_observed_at":"2026-08-02T13:37:01.570731Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-12T15:36:12.578643Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-02T13:37:01.570731Z"},"links":{"cited_paper":"/paper/2505.21411","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:799eb4e243e9cf04d0ebd73bf5a02118ac0af0a00cac5eabe33262baaf07046a","observation_id":"0ef1004e-7f20-4668-a9f4-7ea44f98a8c8","resolution":{"observed_at":"2026-08-02T13:37:01.570731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21411/citation-record","integrity":"/paper/2505.21411/integrity","json":"/paper/2505.21411/citation-record.json","paper":"/paper/2505.21411"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:03.665987Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"4b283a27-6d60-4969-8fb6-62973719b25d","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.901900Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:740d112388e18ee271d8d4000a9ee545588e23a6c462111bc4d81feb300b3d9b","observation_id":"b855188c-e03c-4ef2-9090-89f9eaba304d","resolution":{"observed_at":"2026-08-07T13:36:03.763370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T13:35:51.044133Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.044133Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:1a5c9ccc90736b3b26fd8a20161b6cc0cd9484334c1ae4d217c46bcfd784f107","observation_id":"20a1e3b2-6c9d-47e2-9744-8dd0fae02106","resolution":{"observed_at":"2026-08-07T13:35:51.044133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:03.437411Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"a9c63937-009d-4956-8008-76b8ce727f51","year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.152161Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:5c8c2b0a2739e5f9458a21956574595389003862c20688dc4616f32b68bf4843","observation_id":"803c82a9-0f79-43b2-82a7-1a30b367d0ae","resolution":{"observed_at":"2026-08-07T13:36:03.562289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-16T13:39:21.916392Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T13:35:51.300731Z","title":"A survey on mixture of experts.arXiv preprint arXiv:2407.06204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.300731Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:5edba8b800a8e52bd51e94c9b23bbf2115fcb3d8f0dc1a2cdb148fc4e720cfa7","observation_id":"05661c6c-6c28-46c0-90ae-1de9e6cfb006","resolution":{"observed_at":"2026-08-07T13:35:51.300731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T13:35:51.384764Z","title":"Cummings, Matthias Plappert, Fotios Chantzis, Elizabeth Barnes, Ariel Herbert-V oss, William H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.384764Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:42bb6a217d1b3838d4683759665f146be24c1bc66dafc8d9a0dd39f729cd4a74","observation_id":"6ba32807-dd8a-49d8-9e1f-fb295dc296aa","resolution":{"observed_at":"2026-08-07T13:35:51.384764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:35:51.500132Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.500132Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:8f6bc079b5ab2d8420b2da9309a5468fe9edb28b403a41be256deb5a148615d1","observation_id":"24243e89-b590-4561-989a-bb6cf7795e16","resolution":{"observed_at":"2026-08-07T13:35:51.500132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:03.267567Z","title":"A span-extraction dataset for Chinese machine reading comprehension","venue":null,"work_id":"665d7e57-df74-48d3-8838-36c8a3a64f41","year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.571331Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:561f752db850d408d4cc02df4dfca17ede14ec8812cab1fca41a7ae916ffdce5","observation_id":"4df660e0-9a18-4203-9e78-19b8b0bacf8f","resolution":{"observed_at":"2026-08-07T13:36:03.344965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.674744Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.674744Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:3ac3fb3a4f63ac317d25b6219f90c4674c100991c8c8b8ff15e3b182d59abe24","observation_id":"5c3692cb-1394-4079-89d5-a1043a3f174b","resolution":{"observed_at":"2026-08-07T13:35:51.674744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:03.045477Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"d1017b41-1886-497b-b503-7138cef6dcd9","year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.756522Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:d74afcd04010a983164829ba959a86111596d0bb0615403e8fb2f79c1e178b38","observation_id":"4898aa2f-192c-459a-8c06-479a06c6b5a4","resolution":{"observed_at":"2026-08-07T13:36:03.086337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T13:35:51.893018Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.893018Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:f97b7c456c93fc379c7d9cd7ea2ae8f84da9f01dabb6bb35e89f96d3deae2fa7","observation_id":"01120521-6f69-499b-bb85-5c6a6cc6dcf8","resolution":{"observed_at":"2026-08-07T13:35:51.893018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.064746Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.064746Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:709c1b873728d795f22e249f26888b6e0813858e2e6899f6edcd7df9f5628c18","observation_id":"c49740f1-ddfa-4f92-b5dd-1853c39f8079","resolution":{"observed_at":"2026-08-07T13:35:52.064746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T13:35:52.155499Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.155499Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:c80efb4baa24ff13277a259a93f032af9f53e648d7018e294c4e88e5bf76576a","observation_id":"32a66376-808e-40a2-b052-538e309a3dd6","resolution":{"observed_at":"2026-08-07T13:35:52.155499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:35:52.239596Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.239596Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:088a26bd27a14d6eb6c2789f44e50fd9ad1caa540072d994294e6e24e0c80632","observation_id":"26f6141c-8ec3-49eb-b6cc-272231920d21","resolution":{"observed_at":"2026-08-07T13:35:52.239596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-16T15:33:11.415713Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-07T13:35:52.311217Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models.ArXiv, abs/2305.08322, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.311217Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:b3c99db614ae153f4fff8b70b3de9130367aaa9a9b687b01b6b6dacbcb564a6f","observation_id":"1bcf451e-8314-4a67-951a-44c295da1da4","resolution":{"observed_at":"2026-08-07T13:35:52.311217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T13:35:52.466639Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.466639Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:97daae295d77b4cc792d7c6b511421abb438246257f4adb752ce7a6fe10b43ae","observation_id":"4c042ef2-323a-4bd5-aa4c-1c12487095f9","resolution":{"observed_at":"2026-08-07T13:35:52.466639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T13:35:52.554005Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.554005Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:bbc5ac84438460598d576c864e49c277ebeccde5b3511d41eaebb5dc8e72101a","observation_id":"000c857e-ab4c-477e-9df9-7b927b873625","resolution":{"observed_at":"2026-08-07T13:35:52.554005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-14T21:06:35.519870Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-07T13:35:52.638310Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.638310Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:cf9356d0f7c4092118da3c899a175a5c95522b8d484ed79a7916fce828687e37","observation_id":"d033ed14-cb67-4d2d-ae89-12e0161c61c2","resolution":{"observed_at":"2026-08-07T13:35:52.638310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.750396Z","title":"{GS}hard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.750396Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:3b211f3aa893612b9492f1015b52412709496153dddb1567855af5562176fcaf","observation_id":"465249dc-4a8a-4f8a-bad4-9eba3a976795","resolution":{"observed_at":"2026-08-07T13:35:52.750396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-07T13:35:52.904766Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese.arXiv preprint arXiv:2306.09212, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.904766Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:9e6cba2a9507902ba90175a75e2794b8be6041b85dd9291fcd4671ef401ca50c","observation_id":"711085a9-581a-4e4d-a1a4-378648a52233","resolution":{"observed_at":"2026-08-07T13:35:52.904766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.053387Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.053387Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:0c665008c31d3151de282ac52f3a9dd84febf4bd7a24f873fe0d16167b1c9882","observation_id":"c619d4d9-38c0-4d24-b3b9-bf21aabb4f44","resolution":{"observed_at":"2026-08-07T13:35:53.053387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:02.875483Z","title":"Ccpm: A chinese classical poetry matching dataset, 2021","venue":null,"work_id":"95423152-e20c-4450-8fa1-6ab8adb03ecd","year":2021},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.158919Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:068c7fe1f5e234fe79902993fc4dcf8c951cd6b4607103347d5a688257783cc2","observation_id":"eef40266-67af-4058-8cb1-d56f9e858a07","resolution":{"observed_at":"2026-08-07T13:36:02.931095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:02.561551Z","title":"Kvtuner: Sensitivity-aware layer-wise mixed precision kv cache quantization for efficient and nearly lossless llm inference, 2025","venue":null,"work_id":"8674e8d2-a8f9-4d08-b779-6a1a9f6f3757","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.296758Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:dcb5a79d940b7d40c585d3cd1c0e54a4838a8499bdabad15fee507d670d236c7","observation_id":"d45ac6b6-2732-46e0-86bb-3bf85bd9bcc1","resolution":{"observed_at":"2026-08-07T13:36:02.740107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:02.335657Z","title":"Davinci: A scalable architecture for neural network computing","venue":null,"work_id":"6323e45e-5c48-43ba-89c2-9798d81d7d92","year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.415568Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:9e9d6afa5e70c34e88c7e94a6e0a9f0e19b8481436188cf7a3f14c5ed80206b3","observation_id":"1b90d2b4-b040-4f0e-8837-1171aab4a4a6","resolution":{"observed_at":"2026-08-07T13:36:02.438510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T13:35:53.477835Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.477835Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:dc6251dc728f099ac26395f6457f06c011043399ced20b33720c5e74a3f7f283","observation_id":"4c6ba6b6-a0ac-4584-91cf-9298b6ab34ed","resolution":{"observed_at":"2026-08-07T13:35:53.477835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T13:35:53.562870Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.562870Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:154a815f34fb032bd881b6ba42e14fbaa39b9203446d1d52d4ad4c7cbec884db","observation_id":"27798dcc-671e-4c94-8380-f44afbf9d32a","resolution":{"observed_at":"2026-08-07T13:35:53.562870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.689480Z","title":"Codeforces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.689480Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:dd5fc183998e96f07aff0befadb5643199f3f1a3d6addaf863f6bff09b502d05","observation_id":"07dffa8a-f0b5-4cb6-8439-29ae8354267e","resolution":{"observed_at":"2026-08-07T13:35:53.689480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:02.150611Z","title":"Codeforces","venue":null,"work_id":"f995ea7b-469c-4591-bb61-d7d42f3fde03","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.801569Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:5c2ccb9351eda079ad8c86d40681e5bebab7ef62b38bb63d275b21746f94cb70","observation_id":"f515775d-e498-4e72-ac21-706508a466d0","resolution":{"observed_at":"2026-08-07T13:36:02.238578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.906262Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.906262Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:f5097ff6e8d6fab7809089df1cf26274ad1c0590088f724f08447c76c93a3357","observation_id":"b8c44789-3cc0-47f1-9ad6-3af9955c7c49","resolution":{"observed_at":"2026-08-07T13:35:53.906262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.018931Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.018931Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:115ccded9896a121dc72465d6774c0ac9ffe86d5410aae25539e2055190a66cf","observation_id":"b8149bf8-bdc2-4232-b1dc-adba50e43d94","resolution":{"observed_at":"2026-08-07T13:35:54.018931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T13:35:54.126595Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.126595Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:f63f94f351a18983beb73f7f3dead0b4f39b27b254e9e8854731fcd85d7658b6","observation_id":"4c248afc-00e3-45ab-bbc1-d8b945517e90","resolution":{"observed_at":"2026-08-07T13:35:54.126595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:01.831023Z","title":"Language models are multilingual chain-of-thought reasoners","venue":null,"work_id":"2ba56b4e-5906-4014-b369-baba7ab610b4","year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.213914Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:756656ff3f855aa1342dad8864a074ec977034b6f3f1a21f16fd0d37c4936f50","observation_id":"cc285603-26f3-4e76-825e-7c43a1894820","resolution":{"observed_at":"2026-08-07T13:36:01.998947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:01.521332Z","title":"Investigating prior knowledge for challenging chinese machine reading comprehension, 2019","venue":null,"work_id":"7b978047-3990-41ab-ba22-e69259503b29","year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.306163Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:e40fbacd5fd740f73fdb77692f42068141a159f483c2925f2a5fa8e6cea39387","observation_id":"6f7cca01-fe35-4e23-95d2-8e6c671e452e","resolution":{"observed_at":"2026-08-07T13:36:01.643461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:01.301033Z","title":"Le, Ed H","venue":null,"work_id":"9de0f044-8287-4dc5-998c-2a2d99025619","year":2022},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.379375Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:fd04f47f7c55f94c76188b6edd6cd22e249bed13449b215297e75951f5359675","observation_id":"fb285300-4e45-4f8d-afce-a2d1df2fa8f0","resolution":{"observed_at":"2026-08-07T13:36:01.406635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:01.082225Z","title":"Pangu ultra moe: How to train your big moe on ascend npus, 2025","venue":null,"work_id":"23d80530-e1f7-490e-8f69-c27815b57b6b","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.490378Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:14a44b2b9a0ddee2b8c96e397fa170507ef4bc37b42827d764d0a5266ff7942c","observation_id":"60074898-431a-4f56-a300-27296aa3bbe6","resolution":{"observed_at":"2026-08-07T13:36:01.188216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T13:35:54.574290Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.574290Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:1064def1d225b46b137552df8dbbbb7822fb2cb65fb3951572294e6857d318fd","observation_id":"08d160ef-1a29-40e1-96d9-e161378cbc5a","resolution":{"observed_at":"2026-08-07T13:35:54.574290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.816525Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines, 2025","venue":null,"work_id":"17852f85-0a91-4b0c-b38b-3e1e1b3b94b4","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.750076Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:6fba462f5116e34c03964f79fe6c04b94a3aeedfa8a5c42bd2655fadb8b05e4d","observation_id":"5ef1b1d4-71fb-40ed-9cfe-dfcd6d386960","resolution":{"observed_at":"2026-08-07T13:36:01.008729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:35:54.902110Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.902110Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:102916b0a72e272305ba604eb6bb394f3e6dfc2d8c21f35038dd65177267efc7","observation_id":"dd661264-2204-45bd-949a-30a543b610c4","resolution":{"observed_at":"2026-08-07T13:35:54.902110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.984910Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.984910Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:81e98c8a4e36d6219f68c8a5fcffa08a5db4f23a0bb907d00c05b79531dc7b2c","observation_id":"bc18a172-d754-470f-87cb-b92cb1d6224b","resolution":{"observed_at":"2026-08-07T13:35:54.984910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17276","last_updated":"2023-12-27T11:49:24Z","snapshot_observed_at":"2026-08-16T14:31:24.602856Z","submitted_at":"2023-12-27T11:49:24Z","title":"PanGu-$\\pi$: Enhancing Language Model Architectures via Nonlinearity Compensation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17276","snapshot_observed_at":"2026-08-07T13:35:55.098832Z","title":"Pangu- π: Enhancing language model architectures via nonlinearity compensation.arXiv preprint arXiv:2312.17276, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.098832Z"},"links":{"cited_paper":"/paper/2312.17276","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:22d8d02d535cebcdbab705c0f6faba997fbee8d40ae1548bced60697e1aa04cd","observation_id":"c98d2a89-2b72-49a6-836f-e37b4a6df0d1","resolution":{"observed_at":"2026-08-07T13:35:55.098832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.558802Z","title":"Cmath: Can your language model pass chinese elementary school math test?, 2023","venue":null,"work_id":"00d9bdbc-f820-412d-947a-e0e24433030b","year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.165514Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:2f179d6525bfdac40d812a81f2d39329c0a439d3423159e856c1baca1f980583","observation_id":"4abde72f-a772-4efa-8c97-4ae4359240d4","resolution":{"observed_at":"2026-08-07T13:36:00.679607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T13:35:55.317410Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.317410Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:a6fc0f5623ed2bf06ceb2fbc8e8d7f56bdd2e77ab87fa1eab38a1eaac0868bdd","observation_id":"dc76f2d3-cea4-403f-ba56-0dac811f79e4","resolution":{"observed_at":"2026-08-07T13:35:55.317410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05986","last_updated":"2020-11-05T14:46:45Z","snapshot_observed_at":"2026-08-15T13:01:59.880479Z","submitted_at":"2020-04-13T15:02:29Z","title":"CLUE: A Chinese Language Understanding Evaluation Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05986","snapshot_observed_at":"2026-08-07T13:35:55.479079Z","title":"Clue: A chinese language understanding evaluation benchmark.arXiv preprint arXiv:2004.05986, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.479079Z"},"links":{"cited_paper":"/paper/2004.05986","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:9c6a64f3058e77678fa85d2d661833e33de2cc1f94bb506fc8468f95d4b3fd21","observation_id":"94c05d5a-9d1a-4f1b-8bce-a9a013273df9","resolution":{"observed_at":"2026-08-07T13:35:55.479079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T13:35:55.550408Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.550408Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:d2189d801b39fdc56e1f0283ae7d8106f09fd0cf12dcd089527d0ed63e24f1a1","observation_id":"1a85f877-4bf4-446d-9838-7e91a55719e4","resolution":{"observed_at":"2026-08-07T13:35:55.550408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:35:55.682799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.682799Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:f9a88acb4bf8e1872da0b3ad95f8e0b7dade283b32a446f2b1eabb3572276979","observation_id":"ebc41cbe-8226-41e9-ba32-7ec28839adf8","resolution":{"observed_at":"2026-08-07T13:35:55.682799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.04077","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.597084Z","title":"Attentionpredictor: Temporal pattern matters for efficient llm inference","venue":null,"work_id":"cfa645cb-902e-4e15-99ce-aca1826e7c28","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.801566Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:2b6cb9030dcc9b39ad2a430e8cb2e97b54b75ea082788d237c4630dc8293d488","observation_id":"e8fa8b89-0d9e-48be-89c1-385f96c35fe7","resolution":{"observed_at":"2026-08-07T13:35:57.655602Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06645","last_updated":"2024-07-11T03:06:45Z","snapshot_observed_at":"2026-08-16T22:28:42.649286Z","submitted_at":"2024-07-09T08:14:29Z","title":"Entropy Law: The Story Behind Data Compression and LLM Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06645","snapshot_observed_at":"2026-08-07T13:35:55.872646Z","title":"Entropy law: The story behind data compression and llm performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.872646Z"},"links":{"cited_paper":"/paper/2407.06645","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:23e377e21a4af336a8ecaacf3135e96ead800edb4465838d4c7e8d88969d87ef","observation_id":"7d93ee82-3d6f-4c76-bed3-44042e87cd8b","resolution":{"observed_at":"2026-08-07T13:35:55.872646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.358510Z","title":"Pangu ultra: Pushing the limits of dense large language models on ascend npus","venue":null,"work_id":"24a9c2f5-835a-469f-bd77-9f3d09dcf5e2","year":2025},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.939260Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:65da6d4860a2a393ded25bba436c3e104c74014157a38a85f22411fee65f7ddd","observation_id":"9d95d959-f21a-4da6-a341-6e665856c1fd","resolution":{"observed_at":"2026-08-07T13:36:00.480023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.156919Z","title":"Hellaswag: Can a machine really finish your sentence? InAnnual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":"92a57610-460f-46e8-b4f5-cfd01f4870f5","year":2019},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.037799Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:dfc20248e09d52950c6ca4e17b5617071a87861189d6db2653bd5935198cb2b7","observation_id":"4f27fcae-6385-4473-9f66-2f218323e3db","resolution":{"observed_at":"2026-08-07T13:36:00.279184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T13:35:56.134395Z","title":"轻解罗裳，独上兰舟","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.134395Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:cdc4788081266b5bbfc731e6d979b0871c653f6c89874703199799be2f1ec88c","observation_id":"1709d3b8-26c9-47cf-9ca4-98370c602a73","resolution":{"observed_at":"2026-08-07T13:35:56.134395Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.958630Z","title":null,"venue":null,"work_id":"4039334a-772a-4f5e-8c61-ab20ef3c7423","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.218193Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:272652bb54e5a18b9997183e85168c92ee2ab106dd85af385741e9b1052ecb01","observation_id":"5076e4ab-f1f4-40e8-8aca-5afaf105708d","resolution":{"observed_at":"2026-08-07T13:36:00.062569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.716595Z","title":null,"venue":null,"work_id":"6ba7de08-e1d7-4701-b436-ebe94d5742c4","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.302424Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:e50b655c2436784a10f54210915b676837afd766e5f6ae44abba5c3a15d26b41","observation_id":"94153891-73cd-4b5c-abc5-6dcd770e983c","resolution":{"observed_at":"2026-08-07T13:35:59.873313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.439699Z","title":null,"venue":null,"work_id":"432a0c74-7837-4852-ae04-c8cc3de5ddb5","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.386827Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:85fb36d4b2172d0dff149771692e2c5cff3c3bfb6ca417730852c48411f3abaf","observation_id":"ff6634e4-88b8-455f-ae8f-2246b212e31e","resolution":{"observed_at":"2026-08-07T13:35:59.582421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.183633Z","title":"如果昨天是明天就好了，那 么今天就是周五了，请问今天周几？","venue":null,"work_id":"13a9b401-bdf6-4ab6-9980-0f29d0f71f58","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.470932Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:3fa1f2834810748c726ccba0db4be1f3c10d9183aa7eecfcc6ec118fffb191c4","observation_id":"f7be79a0-b7e8-4517-93eb-fd51ed3b1c95","resolution":{"observed_at":"2026-08-07T13:35:59.277506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.026166Z","title":null,"venue":null,"work_id":"36e5930f-8943-4322-a4f2-d17f47ac311c","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.564230Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:a6d0e242456424b0745ed0f25b5f23ee723033736f40ba0b1428772280cc9e46","observation_id":"d54ffbae-2be4-4f69-83ca-80be5952a5d9","resolution":{"observed_at":"2026-08-07T13:35:59.110140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.839412Z","title":null,"venue":null,"work_id":"9ee9dbaa-8242-445d-95e9-fbfdb2a09299","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.680810Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:b194f8b8922f2c5588006deb221b9fbe993f3ec674ccf4df74348906829ac405","observation_id":"128a9e12-4515-435b-94f4-73145921dbbe","resolution":{"observed_at":"2026-08-07T13:35:58.913775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.735899Z","title":"昨天（假设中的）是明天（实际中 的）","venue":null,"work_id":"6034a7c5-7482-49c0-89aa-65f15799d44f","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.776203Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:7bf3185d60f713fa023cb115b95e5a3489eea7b1d64d0a245a623857d7224af9","observation_id":"3d796c94-213a-405d-87ef-42796f620934","resolution":{"observed_at":"2026-08-07T13:35:58.769344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.614264Z","title":"左”为尊贵方位（如 “左丞相","venue":null,"work_id":"7f1c8698-3764-4db5-b27b-9a0f394d1c19","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.875317Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:225c03cc91c6f295d10b6b60d400cdd390808664c36d8dc35bc0eb640a4f9251","observation_id":"969e8356-9cfc-4f6b-bc7d-f93e9fcc8f0a","resolution":{"observed_at":"2026-08-07T13:35:58.650902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.335095Z","title":null,"venue":null,"work_id":"eb2275f5-4ad5-43bd-8ed7-6c95280f8b77","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.947638Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:113516e26e19f6a9aa554efd9907c8b95eb978e0dd5f08d1e44ec40ab5909ca8","observation_id":"13005985-dbdf-4573-ada7-21c12e2b617b","resolution":{"observed_at":"2026-08-07T13:35:58.539328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.142301Z","title":null,"venue":null,"work_id":"7dddc318-0da7-4fd5-bead-d8e45ea57120","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:57.084177Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:a23b9661ed663ef48888252b430c4f860e869a17e97b85c42b59ea0b2bd91e84","observation_id":"ebb67527-ed75-4bc0-abc0-86149f2015c6","resolution":{"observed_at":"2026-08-07T13:35:58.227678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.977564Z","title":null,"venue":null,"work_id":"26bdbaaf-b03a-44b4-8d7f-31d0671ef07d","year":null},"citing_paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:57.253552Z"},"links":{"citing_paper":"/paper/2505.21411"},"observation_digest":"sha256:ce82bd62d5d6341007cc7f23a4aa84e658d2b0f846a0bd2839d08cc7c6aa71d4","observation_id":"2ebc6305-a3fa-4426-82df-3a714b160c14","resolution":{"observed_at":"2026-08-07T13:35:58.051076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21411","last_updated":"2025-05-28T10:42:15Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T16:45:29.754268Z","submitted_at":"2025-05-27T16:40:21Z","title":"Pangu Pro MoE: Mixture of Grouped Experts for Efficient Sparsity"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 10 inbound Pith citation observations for arXiv:2505.21411."}