{"as_of":"2026-08-19T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9ce8819d23059359708fb53cb014392c4e4e0ba87e63db3f38578c905f1982f","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:36:22.161515Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:13:36.738474Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T07:11:53.241949Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16205","snapshot_observed_at":"2026-08-15T20:13:36.738474Z","title":"Mh-moe: Multi-head mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13840","last_updated":"2025-05-20T02:27:08Z","snapshot_observed_at":"2026-08-16T17:38:14.727696Z","submitted_at":"2025-05-20T02:27:08Z","title":"EfficientLLM: Efficiency in Large Language Models","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-08-15T20:13:36.738474Z"},"links":{"cited_paper":"/paper/2411.16205","citing_paper":"/paper/2505.13840"},"observation_digest":"sha256:b8f2e7173818c3568aa8459bb9f455931757b3b0eeabc61f0b78622dd3e37fd7","observation_id":"b79690c4-2579-4575-81af-b9fd1e91dc5d","resolution":{"observed_at":"2026-08-15T20:13:36.738474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2411.16205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16205","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c63c2fc-976d-4719-bcb0-0a1a4d38a08e","year":2024},"citing_paper":{"arxiv_id":"2604.16930","last_updated":"2026-04-18T09:28:23Z","snapshot_observed_at":"2026-08-15T09:12:04.785679Z","submitted_at":"2026-04-18T09:28:23Z","title":"CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T07:09:48.239662Z"},"links":{"cited_paper":"/paper/2411.16205","citing_paper":"/paper/2604.16930"},"observation_digest":"sha256:e2ddbdb8070b6c616abb047ecceb91de25ce88058dc2d7412b45250e5af585b1","observation_id":"3a1c93c9-6a87-46ad-9b8d-ebeba8ea395b","resolution":{"observed_at":"2026-05-10T07:11:53.243173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16205/citation-record","integrity":"/paper/2411.16205/integrity","json":"/paper/2411.16205/citation-record.json","paper":"/paper/2411.16205"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.01169","last_updated":"2022-02-09T11:07:21Z","snapshot_observed_at":"2026-08-16T17:24:04.119864Z","submitted_at":"2022-02-02T17:58:52Z","title":"Unified Scaling Laws for Routed Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01169","snapshot_observed_at":"2026-08-12T13:36:22.060160Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.060160Z"},"links":{"cited_paper":"/paper/2202.01169","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:b9869361665a4db51a0ab5ae9edd252990ac62c104b485fb6e41e362681a9753","observation_id":"9f772b9f-db1b-4702-acc0-211d23f566d6","resolution":{"observed_at":"2026-08-12T13:36:22.060160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.532697Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":"b883f973-a02e-4fbc-9a07-c2ad521ba92e","year":2022},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.066880Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:cbdbac8e2827c49a1c5f12ce7a1cc6d8c9b505b6ff7d5ba8a0dd08a90b953d00","observation_id":"55be5405-1829-435d-ab92-8b65b5b0a414","resolution":{"observed_at":"2026-08-12T13:36:22.538281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.074453Z","title":"Redpajama: An open source recipe to reproduce llama training dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.074453Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:005f780669e497189d0b44707c843c5348e5d86cffe23ee1dfbe7677ed5cef8a","observation_id":"dbaff43e-891c-4416-8036-fd6580c6873e","resolution":{"observed_at":"2026-08-12T13:36:22.074453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T13:36:22.080452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.080452Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:5f88e554125fd4694ab6999ea7c2c341ff05ceb8e1b59f6c894fe162164eb11f","observation_id":"92bc78df-b855-43ef-9d3a-6da1f4159854","resolution":{"observed_at":"2026-08-12T13:36:22.080452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-08-19T08:05:00.111646Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-12T13:36:22.087205Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.087205Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:41898267bf6a273a22c116d72dd29d9a4d523cdfaec6df496ccac6d6ab8493b7","observation_id":"3512a424-659b-4d05-8c2c-aeccb0abaf4f","resolution":{"observed_at":"2026-08-12T13:36:22.087205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T13:36:22.094853Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.094853Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:a8bb8aed85fc96d78e59defd4fe04aa159ee877b6f25b4f2c69e89ce5498d68a","observation_id":"e40960bd-62b0-4b0e-8396-f6a4bb71df0f","resolution":{"observed_at":"2026-08-12T13:36:22.094853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05820","last_updated":"2022-01-04T06:15:24Z","snapshot_observed_at":"2026-08-16T17:35:30.286365Z","submitted_at":"2021-12-10T20:37:03Z","title":"Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05820","snapshot_observed_at":"2026-08-12T13:36:22.102485Z","title":"Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.102485Z"},"links":{"cited_paper":"/paper/2112.05820","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:1295650ed8181fb5a125c702f016e5008347330c9d02683ade7c39218760e4ae","observation_id":"c5d00a8c-1b1a-463e-aefc-eada142594db","resolution":{"observed_at":"2026-08-12T13:36:22.102485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T13:36:22.110704Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.110704Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:04e0c48bbbd12f1cbda9fc45c2e4eb0175bd5b8df77a38763774a77d09f545a0","observation_id":"ace33193-78a4-4200-afb9-43bb5dc90c2a","resolution":{"observed_at":"2026-08-12T13:36:22.110704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-14T15:17:37.878305Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-12T13:36:22.116961Z","title":"The era of 1-bit llms: All large language models are in 1.58 bits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.116961Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:f1bd17746d2325d9b6da6afee8cda456ca3a0dc819db09f06a6851c1fd88c274","observation_id":"db7bfbcd-d3b1-4bb7-a5b9-42a4fd43a481","resolution":{"observed_at":"2026-08-12T13:36:22.116961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15772","last_updated":"2023-10-24T22:59:26Z","snapshot_observed_at":"2026-08-19T04:13:51.103407Z","submitted_at":"2023-08-30T05:41:29Z","title":"Task-Based MoE for Multitask Multilingual Machine Translation","version":3},"cited_work":{"arxiv_id":"2308.15772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.15772","snapshot_observed_at":"2026-08-12T13:36:22.206098Z","title":"Task-Based MoE for Multitask Multilingual Machine Translation","venue":"cs.CL","work_id":"65f0f814-5f7c-4112-83f7-7a6f84b6e19e","year":2023},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.122709Z"},"links":{"cited_paper":"/paper/2308.15772","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:56aca240685e984910bb968640f7266db20fb330756f65ffd73a7accf173d1ef","observation_id":"008f5eab-48bc-4fc2-a7bc-761799eff79c","resolution":{"observed_at":"2026-08-12T13:36:22.214087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.128726Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.128726Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:86fa299c7a3ab0e6c5ebfbb7825e568ff6f565a6800a1f50f08c681010ce49c0","observation_id":"317e6bd1-2d98-465c-a436-3c3c3e857a66","resolution":{"observed_at":"2026-08-12T13:36:22.128726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.481037Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"0002e837-2324-4240-b823-c266409f5f15","year":2019},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.135594Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:5a5ae5285a9c32a6e77b19ce4d6ad08ae6ac9df739cfb365c90cffe6ad363c4c","observation_id":"f2fe8c18-f4c9-4840-b3c8-5dd8a333a288","resolution":{"observed_at":"2026-08-12T13:36:22.487038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.140800Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.140800Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:783ba12bfec175e2d72e1d66fe7e9260a56c4b52f7227ad4919a53d6d2ab00ec","observation_id":"81c405ce-8d53-4abb-b2d8-484bd882e0a7","resolution":{"observed_at":"2026-08-12T13:36:22.140800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.448284Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"61a53c70-996b-474f-9f97-e4f26deef921","year":2017},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.145987Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:1e48ce8f8e0124e019f1f9d7bb39bc62dd863928ee01e1dc62105a9346e4c792","observation_id":"6ead7d61-f527-4df4-b62a-9c54c92cab1b","resolution":{"observed_at":"2026-08-12T13:36:22.454163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.150888Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.150888Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:48cf0ba6815d4450d5150165e449bcbe8a27f67d652f8dbb014aec2aec094e90","observation_id":"21a5d4f9-0246-4e28-b23e-fda064011781","resolution":{"observed_at":"2026-08-12T13:36:22.150888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.417685Z","title":"Multi-head mixture-of-experts, 2024","venue":null,"work_id":"b82b123b-d997-4315-a169-92261a8ffdbe","year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.156005Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:ffc89ad4583ebf02d6613b5b85348b90e0bb951f3435808df7f796f6151aaa13","observation_id":"27c9b5cb-6aff-4ab6-a9ce-a943f1d78f36","resolution":{"observed_at":"2026-08-12T13:36:22.423691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.396984Z","title":"Sparse moe with language guided routing for multilingual machine translation","venue":null,"work_id":"b2cfee10-c3c5-48bf-a990-116a2acd2ff1","year":2023},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.161515Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:4f9f712aa8044ac481c724cfd826c0ad9a938df32b586620583c7a0fe4302ebd","observation_id":"cf163fbb-fc4b-4516-949e-008540e77a9e","resolution":{"observed_at":"2026-08-12T13:36:22.404450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T09:24:34.961721Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 2 inbound Pith citation observations for arXiv:2411.16205."}