{"as_of":"2026-08-20T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:706d6eadba567d02da8ce8049e9246edc462fd6f2c62b779fc97bf68bb20f7b8","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:32:03.727373Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10530/citation-record","integrity":"/paper/2509.10530/integrity","json":"/paper/2509.10530/citation-record.json","paper":"/paper/2509.10530"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-15T16:32:03.102282Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.102282Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f99d1ee9755088d70c3f7ad638dc4b922dc35c30840acc24917c518ba9634527","observation_id":"b21f112d-6e84-4952-a97d-2b5314cff2ee","resolution":{"observed_at":"2026-08-15T16:32:03.102282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.114581Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.114581Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:312cf9d52620bf8515d1df6f3aa62331900a4a0760c5a8200b9fa2fae443dfac","observation_id":"418fec02-e729-4cc7-b677-502c07e9dccf","resolution":{"observed_at":"2026-08-15T16:32:03.114581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T16:32:03.122984Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.122984Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:61362ab2ae9261b818daccee92e0760e5c8c831c8c8390638979753bc706e3e1","observation_id":"a2cfd6db-3aca-4ed1-a360-c97afcc8c9aa","resolution":{"observed_at":"2026-08-15T16:32:03.122984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.132827Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.132827Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f6840e842f99557ceb4da5a5f63dcbe5652e7a77470134c85e2010eb8b2fb542","observation_id":"370dd306-3b37-448e-8b88-6fbb2d425ed9","resolution":{"observed_at":"2026-08-15T16:32:03.132827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T16:32:03.141013Z","title":"Outra- geously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.141013Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:78aa0a6ca9b85c8aa125dbe92263cdfc1dffc1668b008d85b4c4f255c585724a","observation_id":"7f772533-9eaf-4953-b708-019590d4c3b6","resolution":{"observed_at":"2026-08-15T16:32:03.141013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.152543Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.152543Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:de2b8b63f02b10747201e5b6558bd0121ad8974631811997fec55fc620df5757","observation_id":"c026a01c-5db7-416b-af46-ef1937360e92","resolution":{"observed_at":"2026-08-15T16:32:03.152543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.161637Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.161637Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:87c49d16ff91bea980f4558bfcb606802d4b0a1e42ebf4273397a5ef14d1db09","observation_id":"07fe1b71-d834-4af7-9164-0fc1304e57e5","resolution":{"observed_at":"2026-08-15T16:32:03.161637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-16T14:00:03.452025Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-15T16:32:03.168149Z","title":"What does bert look at? an analysis of bert’s attention.arXiv preprint arXiv:1906.04341, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.168149Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:b1960fcad8c33fcd88abe343912e10c7c83786759f7cc341ddc665f7ee0aaac7","observation_id":"0b9c3a84-db0d-4c4a-a20f-374f2e2e96e0","resolution":{"observed_at":"2026-08-15T16:32:03.168149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-14T16:28:06.194757Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-15T16:32:03.174237Z","title":"Analyzing multi-head self-attention: Spe- cialized heads do the heavy lifting, the rest can be pruned.arXiv preprint arXiv:1905.09418, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.174237Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:a47638c64d0ef757244dd5276e5ca1ad8e1a248475e02e6d7399a49cf8f89511","observation_id":"e2464f07-ac6f-458e-b872-bbbfc014d0b7","resolution":{"observed_at":"2026-08-15T16:32:03.174237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.172902Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"c4ae9665-f078-4b76-9bd9-3df992e260c6","year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.181778Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:8d5415323ad6322d74104693896e976383fcd5764ce00789ebed9c667287e53f","observation_id":"845cbdcc-ed51-4c1f-bd48-6711d3a0c56c","resolution":{"observed_at":"2026-08-15T16:32:05.178360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.154643Z","title":"Chatgpt: Optimizing language models for dialogue, Nov 2022","venue":null,"work_id":"4cd3c42e-8401-49eb-85cf-4ccb7a0713bb","year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.188074Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:e97d15bd5efc875f0d93cd7277f1495b2126897e0d41247a0cad551d9b63b4c5","observation_id":"380e7d19-998e-4c41-86d2-dc1cbe62254f","resolution":{"observed_at":"2026-08-15T16:32:05.160707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T16:32:03.196590Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.196590Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:95319a206c0263ed3eef75aa33f522a61b0f3a4dcef9b428dbf24d9113aa66f3","observation_id":"bc83fb04-e1a6-4ac1-905c-270fe3c952d3","resolution":{"observed_at":"2026-08-15T16:32:03.196590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.205921Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.205921Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:c885e23112897169980aa0c4cda5e2eb3690e542a1510b4aa1635ea09099bc71","observation_id":"e0d0b965-b4b4-4de5-b6ca-918a8a3aaf06","resolution":{"observed_at":"2026-08-15T16:32:03.205921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.117477Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"47c3d594-5b7d-4a68-9ce1-5ee0ba3e4053","year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.215508Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:4b4aba0c88d1a170bdf4a699892b38bc83e5674dc5e04c1167b0a50362ece2f0","observation_id":"81c2cb9a-e169-4e83-92dc-b58f18f78bbf","resolution":{"observed_at":"2026-08-15T16:32:05.124029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-15T16:32:03.226383Z","title":"St-moe: Designing stable and transferable sparse expert models.arXiv preprint arXiv:2202.08906, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.226383Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:b16e39c61484fda880c50e3c292e30fc4338200e240134ad2b1969517db5abb3","observation_id":"722a6d10-20c9-480f-9b15-5bc66e284559","resolution":{"observed_at":"2026-08-15T16:32:03.226383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-16T17:20:15.597859Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-15T16:32:03.233617Z","title":"Dai, Zhifeng Chen, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.233617Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:60be68e023f0d2cb1c527b14ce37bb886de94fa02eb957029cd9c1510cf9f5e6","observation_id":"bcdbf71e-4747-4e51-ab4e-fb3743e3a3ea","resolution":{"observed_at":"2026-08-15T16:32:03.233617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.249006Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.249006Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:4b852a6c036835984b3031a16d449a789440ae98f91002a64a7fa29f43c44748","observation_id":"86591840-0333-4746-b4ed-fd9cdb30bf34","resolution":{"observed_at":"2026-08-15T16:32:03.249006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12894","last_updated":"2022-03-16T13:27:44Z","snapshot_observed_at":"2026-08-16T17:46:49.139913Z","submitted_at":"2021-10-25T12:48:07Z","title":"The Efficiency Misnomer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12894","snapshot_observed_at":"2026-08-15T16:32:03.259828Z","title":"The efficiency misnomer.arXiv preprint arXiv:2110.12894, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.259828Z"},"links":{"cited_paper":"/paper/2110.12894","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:e87de6f7e5f4c6a21b10be8a031815822d9cf10db9eab6fa9fbfa63068d52fa1","observation_id":"72e07bab-da7d-412b-82f1-329f27358bbf","resolution":{"observed_at":"2026-08-15T16:32:03.259828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-15T16:32:03.268556Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks.arXiv preprint arXiv:1803.03635, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.268556Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:49f1d9c69a8024f741cd3cc76e49a9e8881c85f842e26bd175d787267fa6dcba","observation_id":"b0f5f81b-586a-43af-821e-6494e872ac9f","resolution":{"observed_at":"2026-08-15T16:32:03.268556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.278164Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33:17283–17297, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.278164Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:7ffd549173b28d80027d2e381f159167858fead4af7a85b66f962c27d27e26f9","observation_id":"382d5947-2e0c-49bb-bc48-93a6cff44cf3","resolution":{"observed_at":"2026-08-15T16:32:03.278164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-20T00:13:57.716002Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-15T16:32:03.286629Z","title":"Long range arena: A benchmark for efficient transformers.arXiv preprint arXiv:2011.04006, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.286629Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:d4c0a683aee4ae03773b36a1435eee582e99a42bfbcdb7f45d8e23e345045037","observation_id":"990c5cbe-0781-49b6-a3b7-c4fe2765a371","resolution":{"observed_at":"2026-08-15T16:32:03.286629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.064477Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":"e62f1be0-d2ae-427f-bf9b-b26fce436524","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.293221Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:16cf954837259c7201e4b05256e7690c8a5aea84333777cc433ab315e3f80f5f","observation_id":"7036773e-43d0-4468-a9c7-c562bbda26f5","resolution":{"observed_at":"2026-08-15T16:32:05.070594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.030515Z","title":"Sparse is enough in scaling transformers.Advances in Neural Information Processing Systems, 34:9895–9907, 2021","venue":null,"work_id":"8f084227-b11f-45b5-963b-bccb1eac9dd5","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.300884Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:a3a162fef2b24be7cd013df02c90f76d4ea77fcd369b806c1ff229c945de29dc","observation_id":"9b4d9c3d-c9c6-486e-8b0b-6a74e6c8c037","resolution":{"observed_at":"2026-08-15T16:32:05.041059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.313419Z","title":"Hash layers for large sparse models.advances in neural information processing systems, 34:17555–17566, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.313419Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:611bfcfd8edcb880e479f5ba4981b83a382c1b5b0d4ed6db4513ca9ac53aec8c","observation_id":"a66adfdd-9e1a-4cc7-ae92-830454ea166e","resolution":{"observed_at":"2026-08-15T16:32:03.313419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.988073Z","title":"Synthesizer: Rethinking self-attention for transformer models","venue":null,"work_id":"bc7ecf01-00a0-4e3d-b7aa-b8bed8610e19","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.323430Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:0bd249056fb3416e96cb023ec6747a566bfffe2a9a7ea80a909b14434cd35652","observation_id":"62556ec8-19e2-4526-b831-7f93dfe37da5","resolution":{"observed_at":"2026-08-15T16:32:04.994516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02143","last_updated":"2021-03-19T21:24:06Z","snapshot_observed_at":"2026-08-16T18:41:40.971095Z","submitted_at":"2021-03-03T02:48:56Z","title":"Random Feature Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.02143","snapshot_observed_at":"2026-08-15T16:32:03.332917Z","title":"Random feature attention.arXiv preprint arXiv:2103.02143, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.332917Z"},"links":{"cited_paper":"/paper/2103.02143","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:15d44706128ed87ccf27eb40c78fd78204a84c9ba5ca2669f1cf6056c6a0e3c4","observation_id":"0554f798-9c13-4e51-881c-71471344b083","resolution":{"observed_at":"2026-08-15T16:32:03.332917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.340929Z","title":"Skyformer: Remodel self-attention with gaussian kernel and nystr\\\" om method.Advances in Neural Information Processing Systems, 34:2122–2135, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.340929Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:b51775c6bdde92b5d4576c0103be4f1cf3d5c9476177935f84e242231a41662e","observation_id":"da608b2d-cd50-4437-8ab0-3fccb3b16c01","resolution":{"observed_at":"2026-08-15T16:32:03.340929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.354871Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.354871Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:69eb9b4fb9505cf98a99bf15d5af30b34e2a0b2c7cbb151f39cd71a2eb48e540","observation_id":"58f8d87c-1034-4894-a51a-7c7ba397f406","resolution":{"observed_at":"2026-08-15T16:32:03.354871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-16T16:12:36.431574Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-15T16:32:03.365892Z","title":"Megablocks: Efficient sparse training with mixture- of-experts.arXiv preprint arXiv:2211.15841, nov 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.365892Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:563034c6bdbce95fe3227d6880e7623a161b97e6c8f9c9c0ad94b01a3b213669","observation_id":"d3dd0fbf-0933-4c95-937e-b3e43f08fe74","resolution":{"observed_at":"2026-08-15T16:32:03.365892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.939176Z","title":"Flex- moe: Scaling large-scale sparse pre-trained model training via dynamic device placement.Proceedings of the ACM on Management of Data, 1(1):1–19, 2023","venue":null,"work_id":"216c933f-94b8-42f3-b0b1-0fb928b0e968","year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.381550Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:ae6430166b7d57f291d123f9d4942cfbf19b796c3912e3ee4b2c2c9156894c9e","observation_id":"e0d273da-fc0a-4fcb-811e-48df01efc227","resolution":{"observed_at":"2026-08-15T16:32:04.947004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.917950Z","title":"Go wider instead of deeper","venue":null,"work_id":"c1d4587d-76d0-4b3f-a436-c1c465625416","year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.388315Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:aac4d9e54be15ac24501e725f7bfd49bfe1402b2c854a4ce0a5ffd31909fee15","observation_id":"89e83ad8-8caf-4f34-9518-5d356499d39d","resolution":{"observed_at":"2026-08-15T16:32:04.923186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-08-18T01:27:11.590348Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-15T16:32:03.398538Z","title":"Albert: A lite bert for self-supervised learning of language representations.arXiv preprint arXiv:1909.11942, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.398538Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:0531f5d8142c2f9f42089cf6d70184f4b2bc6d04f56a1904a032a1b0a9c412b9","observation_id":"14c12484-f515-47ff-be29-bd1b956b6f9f","resolution":{"observed_at":"2026-08-15T16:32:03.398538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.406558Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.406558Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:7593803bc71ef63b714ebdd19c79d2902dbb2998a3a4d2f887c04959f9588e47","observation_id":"9bdc8378-f738-437a-8556-561e68ffe5d0","resolution":{"observed_at":"2026-08-15T16:32:03.406558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-08-20T09:32:02.065929Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-15T16:32:03.413681Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications.arXiv preprint arXiv:1704.04861, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.413681Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:53e0bdf5030b0f8232148b29336e340cea2ea7bee4b132174d018d81194f58ea","observation_id":"62fac901-0581-4402-8615-6888bd3ccf09","resolution":{"observed_at":"2026-08-15T16:32:03.413681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.422607Z","title":"Dolan and Chris Brockett","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.422607Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:a674579b351ce7f56fa5f13ef191785dca2d114b655e1382147ce845c39a20ee","observation_id":"22b8ed44-bf7b-4baa-891a-8711216a334a","resolution":{"observed_at":"2026-08-15T16:32:03.422607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-17T06:02:42.650883Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-15T16:32:03.432673Z","title":"Efficient large scale language modeling with mixtures of experts.arXiv preprint arXiv:2112.10684, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.432673Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:a646c8baa86e948853553d91f5707f813653072c128966ea9a7f0333a9a7535b","observation_id":"21cc405f-e474-4077-9ae3-3fe9aaad2f20","resolution":{"observed_at":"2026-08-15T16:32:03.432673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-15T16:32:03.440111Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding.arXiv preprint arXiv:2006.16668, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.440111Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:78bb6557a3bd30791511a79a3e5b5de2b9d013d53a9eda6fa7c23f4ddb4c83ea","observation_id":"d8b27b0d-4fc7-4af9-a25c-c2708bd6bcc1","resolution":{"observed_at":"2026-08-15T16:32:03.440111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-15T16:32:03.462100Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.462100Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:076717668c46037d7a713e4a50d3e3ea5b96cbd7964bb7bfc0951ffcbbd61b29","observation_id":"6f302862-a9a5-4880-bb6a-98b23e3ba248","resolution":{"observed_at":"2026-08-15T16:32:03.462100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-15T16:32:03.473597Z","title":"Reformer: The efficient transformer.arXiv preprint arXiv:2001.04451, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.473597Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:9bebfa48cbd585f2ff8148c592be2b8a21db3949451a001688f91cc40b922127","observation_id":"94e832ac-c52b-4e3c-be74-d4fbef186d24","resolution":{"observed_at":"2026-08-15T16:32:03.473597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-15T16:32:03.482557Z","title":"Rethinking attention with performers.arXiv preprint arXiv:2009.14794, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.482557Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:11caa1ac8a211199550467d806450d1834600b2e922ed73d000539c4053bd837","observation_id":"923ac743-556d-46f9-a7ea-c4b6c7c65b90","resolution":{"observed_at":"2026-08-15T16:32:03.482557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.505998Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.505998Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:616cdaf9bb525d25372646e6ce511a7c74e5ae00716da16851d546676273ce97","observation_id":"9c1f67ac-16a8-476c-82fa-13aa06552c53","resolution":{"observed_at":"2026-08-15T16:32:03.505998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T16:32:03.516804Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.516804Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:46d8d85fcb788d41f53ebc6b2f13403520ac18dcb20942f9952d32ffe560aa8d","observation_id":"39b74526-d5c2-4629-bf7c-b2179ccb8030","resolution":{"observed_at":"2026-08-15T16:32:03.516804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-08-16T09:50:11.319379Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-15T16:32:03.530148Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding.arXiv preprint arXiv:1804.07461, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.530148Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:2fc2dd819826063f2466c842874d66f78f598972c7547f16bbd3d1a0ec65ad5a","observation_id":"fea4b75b-7025-4fd8-b160-97d4ce5e80af","resolution":{"observed_at":"2026-08-15T16:32:03.530148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.542392Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.542392Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:2849e5440452325ae9aac68f15d5c9a9db508bf3cde6f82c03dbe6aed47cb11b","observation_id":"67704a54-058a-4ec7-8875-311ae2f4964d","resolution":{"observed_at":"2026-08-15T16:32:03.542392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.836820Z","title":"Measuring massive multitask language understanding.Proceedings of the International Conference on Learning Representations, 2021","venue":null,"work_id":"3339805a-7002-45e7-b10f-5a68e5fdd561","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.549030Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:b67e2e32e204289b1529c9d06013e229abe7bda9865f7b393255073f97a73b89","observation_id":"eb2e7070-68de-4329-a7f9-3679667f5e83","resolution":{"observed_at":"2026-08-15T16:32:04.842222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-15T16:32:03.557780Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese.arXiv preprint arXiv:2306.09212, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.557780Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:b279bb17ed0c2b63561995bceb67c109212aacd1a1e36afda8e21076a7136cca","observation_id":"7767dbbf-f17c-4873-bfe0-d3410182ba68","resolution":{"observed_at":"2026-08-15T16:32:03.557780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-18T15:25:57.481597Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-15T16:32:03.566309Z","title":"C-eval: A comprehensive chinese evaluation suite for foundation models.arXiv preprint arXiv:2305.08322, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.566309Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:09b5d2ab46a48cf751d5306b3bf24ede2ed65db37c06a840425482e80778a3a9","observation_id":"4ccf242e-1ea1-4eeb-9979-d6badaa23c22","resolution":{"observed_at":"2026-08-15T16:32:03.566309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-15T16:32:03.573573Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them.arXiv preprint arXiv:2210.09261, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.573573Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:c692e4b538a5558920a2ed93c9b49f525c472573b3d66b11ac307f10e31fd380","observation_id":"20cff156-4cbb-4f87-9db4-a7e43b3891fa","resolution":{"observed_at":"2026-08-15T16:32:03.573573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T16:32:03.580103Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.580103Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:6d928516ad529a5e9e3f2b5e85af5a1add2e4810faead7d7f363e5b93b63ff98","observation_id":"ef53fdfa-93b6-4e3a-9271-161471d16a54","resolution":{"observed_at":"2026-08-15T16:32:03.580103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T16:32:03.587345Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.587345Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:73a5686313c5422efaa86fbf8b9db26c4d389dc9bcfa6f9c9337a620bb986904","observation_id":"ebc47581-586c-4aff-8f88-cc0b5bc31742","resolution":{"observed_at":"2026-08-15T16:32:03.587345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T16:32:03.598148Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.598148Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:ef269330dc268e49dbbe089f8e55716f69fe8ab53692e43b0868865e53f9bce1","observation_id":"81b3adbe-ecf5-4878-91fb-9c0b0dc9c85a","resolution":{"observed_at":"2026-08-15T16:32:03.598148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T16:32:03.605123Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.605123Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:a558d9be30c85113940806c7eae7a3b47a08650f14666895e9e31b53cb148488","observation_id":"f5338c63-003a-49a5-83da-7e989e0e3965","resolution":{"observed_at":"2026-08-15T16:32:03.605123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.613500Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.613500Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:6dc6c17bec5668d73e1da400c992bc06d0c78d3fac02b0f2a3ff928878cb77fc","observation_id":"d36177ae-036b-41b6-8caa-36cf8829469b","resolution":{"observed_at":"2026-08-15T16:32:03.613500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.619572Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.619572Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:00a0e3f0071d7f1a9d8488adceba0ce4a0344d4ef4e7bcdf948413525adb385d","observation_id":"23e9b094-a44d-403a-a3ec-2ea2b7caa112","resolution":{"observed_at":"2026-08-15T16:32:03.619572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.793188Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":"50045183-e44a-4a0d-ac97-371f36f6fa23","year":2025},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.625468Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:fe3862583830c17411fa22dbf39ca012361b177e9bb147470cb48e5264f9b2ed","observation_id":"4aec8be8-f622-4277-958d-21d921fe120e","resolution":{"observed_at":"2026-08-15T16:32:04.798914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.770476Z","title":"The Llama 3 Herd of Models, 2024","venue":null,"work_id":"1339d268-bde9-47c4-94e2-04405f3918a6","year":2024},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.631773Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:7aa8f06a55983508f321b88ed4022fc1cc3c08c938f9db3d7ef2eff95f075625","observation_id":"5bcd0223-bb1a-419a-9456-10ab6af55da1","resolution":{"observed_at":"2026-08-15T16:32:04.777934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.748678Z","title":"Hewett, Mojan Javaheripi, Piero Kauffmann, James R","venue":null,"work_id":"dfee9b27-afe8-42c4-8094-bae2d810e12e","year":2024},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.640184Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:afa0028214bb0539c8c6bca8855bf5341d608e55d49b3c40131069c6b83e2138","observation_id":"37a12c06-9543-4e0c-bb9f-ddcf54f92780","resolution":{"observed_at":"2026-08-15T16:32:04.754191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09844","last_updated":"2018-06-07T14:39:29Z","snapshot_observed_at":"2026-08-18T16:26:39.664825Z","submitted_at":"2017-03-29T00:19:20Z","title":"Multi-Scale Dense Networks for Resource Efficient Image Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09844","snapshot_observed_at":"2026-08-15T16:32:03.650932Z","title":"Multi-scale dense networks for resource efficient image classification.arXiv preprint arXiv:1703.09844, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.650932Z"},"links":{"cited_paper":"/paper/1703.09844","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:6b49c6b679e6b7229e8264c9ee2cf638b1d3c4da64cefe78238adb5a5ec47bab","observation_id":"8f61c776-484d-4836-ab5f-6d27171eb856","resolution":{"observed_at":"2026-08-15T16:32:03.650932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.664409Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.664409Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:bb742fbfd4f49ee3e1bea2a4e20c1e49a5ba2d71a41cb379b7e7d23ac90cdd98","observation_id":"368fc9a0-32e7-48e7-81f4-69853d82ec85","resolution":{"observed_at":"2026-08-15T16:32:03.664409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.714248Z","title":null,"venue":null,"work_id":"5a254687-e912-4953-a175-ecd2755f5610","year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.675879Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:5665e9a83638b7c4f46626e43fbb32cceaa52f805e601f24bd1f0c8b40fca5bb","observation_id":"6b4450c4-38db-4f31-b009-ecea4e70e44d","resolution":{"observed_at":"2026-08-15T16:32:04.720488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.694932Z","title":null,"venue":null,"work_id":"195c1144-f0c0-4d7c-9972-10b218e6a5b9","year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.681799Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:6d5c95270a4361ae57756ab06e5d3e180268a4d0b1c1b9a231b379bb4a30d22a","observation_id":"6e7cf706-c3cc-450b-9e5a-57ffaaadb444","resolution":{"observed_at":"2026-08-15T16:32:04.700027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.676353Z","title":"Squad: 100,000+ questions for machine com- prehension of text","venue":null,"work_id":"11fd41de-fbb9-439e-956c-d0eb6201b0e1","year":2016},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.687831Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:effd92c4374530eb7ce859dbd2488a6179e04b6c473600342413a3b6bcc69a0b","observation_id":"a72df6b2-87ca-4b4b-a0f8-eb6ad8848330","resolution":{"observed_at":"2026-08-15T16:32:04.681840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.655134Z","title":"The pascal recognising textual entailment challenge","venue":null,"work_id":"e5e09d62-6ea4-45a7-a8c2-d4e6096e24a4","year":2005},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.693730Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:07319f3590a06f7dcad47fdfae73c002e0e8369d9a7492f18c7b23c4ff27cee4","observation_id":"f607e9a1-5cd4-4e2f-84d4-3f398bb577c9","resolution":{"observed_at":"2026-08-15T16:32:04.662745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-15T16:32:03.698662Z","title":"Palm 2 technical report.arXiv preprint arXiv:2305.10403, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.698662Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:8ec2e21c98818929bb4535aa34a56a5a365a7e6db3045700f07bb770c5de9a6f","observation_id":"8f91b630-358f-4061-8801-cb20e554f439","resolution":{"observed_at":"2026-08-15T16:32:03.698662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-16T14:55:55.412977Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-15T16:32:03.704458Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization).arXiv preprint arXiv:2310.01082, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.704458Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:2ef031d6296791f405af89086c2561fb1ad8c550afdd4f3c48ef40ee153936cd","observation_id":"8a9d747b-9a42-4583-9d1b-02b07b4e6363","resolution":{"observed_at":"2026-08-15T16:32:03.704458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.714918Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.714918Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:616754200c38f109e12bb6434002b8bd03e3804553e936eb20d85fbd1fcd166d","observation_id":"fc30f7b7-3e5a-4e4a-80ed-637a98deb910","resolution":{"observed_at":"2026-08-15T16:32:03.714918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03824","last_updated":"2022-05-26T18:50:20Z","snapshot_observed_at":"2026-08-20T04:26:29.382711Z","submitted_at":"2021-05-09T03:32:48Z","title":"FNet: Mixing Tokens with Fourier Transforms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03824","snapshot_observed_at":"2026-08-15T16:32:03.720600Z","title":"Fnet: Mixing tokens with fourier transforms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.720600Z"},"links":{"cited_paper":"/paper/2105.03824","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:c7ecd6ea83e616f06ad6e08ab435f65af87fc859ed75dc65bf6e1e5c64a48d6b","observation_id":"440c65a9-df59-4eaa-99f9-ad67e76f2045","resolution":{"observed_at":"2026-08-15T16:32:03.720600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.06993","last_updated":"2018-01-28T17:12:02Z","snapshot_observed_at":"2026-08-14T21:42:53.838437Z","submitted_at":"2016-08-25T00:44:55Z","title":"Densely Connected Convolutional Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.06993","snapshot_observed_at":"2026-08-15T16:32:03.727373Z","title":"Densenet: densely connected convolutional networks.arXiv preprint arXiv:1608.06993, pages 362–371, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.727373Z"},"links":{"cited_paper":"/paper/1608.06993","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:2903f730469e406f745e65f296004cf3e132b0c05025bda3858625a7e207929e","observation_id":"598c47b0-3365-4852-a613-acafa17a55f4","resolution":{"observed_at":"2026-08-15T16:32:03.727373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:17:32.525369Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2509.10530."}