{"as_of":"2026-08-10T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8389b6e829831ae66acfc0690c676d2ba5a566df4c70082cf64f1f78bedb52b6","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:19:02.406641Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02890/citation-record","integrity":"/paper/2506.02890/integrity","json":"/paper/2506.02890/citation-record.json","paper":"/paper/2506.02890"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T11:18:57.605069Z","title":"arXiv: 1911","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.605069Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:bb92e822a9d8e70232d57ad0d4a6902cd38f4b3ff88823f48562ff49aba7d3b9","observation_id":"23d42a33-69a1-42d0-9044-f9b7cb5f1412","resolution":{"observed_at":"2026-08-07T11:18:57.605069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01169","last_updated":"2022-02-09T11:07:21Z","snapshot_observed_at":"2026-08-09T22:43:05.276517Z","submitted_at":"2022-02-02T17:58:52Z","title":"Unified Scaling Laws for Routed Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01169","snapshot_observed_at":"2026-08-07T11:18:57.728870Z","title":"arXiv: 2202.01169 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.728870Z"},"links":{"cited_paper":"/paper/2202.01169","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:bd1e29f222650b37344ac7051a4e0c4ed021292acab815d6713710aa8d9cf334","observation_id":"6c5c04c0-114f-4b1d-b2e7-e13f50b7573b","resolution":{"observed_at":"2026-08-07T11:18:57.728870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:18:57.847592Z","title":"arXiv: 1803.05457 [cs.AI]","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.847592Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:e4d815be6237a0ab68e5b439df2fca8d576fd4a5e6ad8d0d72e6bcb2b858377a","observation_id":"490955d4-d1fa-4eae-925c-960bfbf0357b","resolution":{"observed_at":"2026-08-07T11:18:57.847592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T11:18:57.953340Z","title":"Wu, Zhenda Xie, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.953340Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:d922a4533873f70705a276dde54fb8fa0889f6752ad49287336d0542a9c126c0","observation_id":"cf6215c0-8604-43ad-88a1-1ade11843c52","resolution":{"observed_at":"2026-08-07T11:18:57.953340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08968","last_updated":"2024-11-13T19:02:36Z","snapshot_observed_at":"2026-08-09T14:19:25.114302Z","submitted_at":"2024-11-13T19:02:36Z","title":"Sparse Upcycling: Inference Inefficient Finetuning","version":1},"cited_work":{"arxiv_id":"2411.08968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.08968","snapshot_observed_at":"2026-08-07T11:19:03.499126Z","title":"Sparse Upcycling: Inference Inefficient Finetuning","venue":"cs.LG","work_id":"520286c1-1155-4caa-88c4-f158b77bfcb9","year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.094528Z"},"links":{"cited_paper":"/paper/2411.08968","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:1f7c53c02eda00638046dc547738feea10c09b5b4a9cc6a645d6c2bf690fe201","observation_id":"7e5135d2-3a1a-4c4a-ab67-87ee6e3f6d41","resolution":{"observed_at":"2026-08-07T11:19:03.596040Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-07T11:18:58.233961Z","title":"arXiv: 2112.06905 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.233961Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:9788cebf702b5cf125421e74fa209e977cbc048f9412e0ab21062c4eddec5215","observation_id":"ac690ccf-7837-4ab3-86b4-91ad969c3ef0","resolution":{"observed_at":"2026-08-07T11:18:58.233961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:18:58.354384Z","title":"(2024).The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.354384Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:833191bcd1a7f79e3e5b790c1150142d57ead5bfa81ca3317498afcd84fd4872","observation_id":"cbcf660c-bf90-4ac9-9fdc-e8586bda8110","resolution":{"observed_at":"2026-08-07T11:18:58.354384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14393","last_updated":"2024-01-19T17:33:44Z","snapshot_observed_at":"2026-07-06T16:23:30.533693Z","submitted_at":"2023-09-25T14:50:04Z","title":"LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14393","snapshot_observed_at":"2026-08-07T11:18:58.457714Z","title":"LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.457714Z"},"links":{"cited_paper":"/paper/2309.14393","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:0990e291fe38488f961c3bda37def187294e8f4e67e4b29b7bf1fe865294fed1","observation_id":"bfaf3d68-9e6d-41b0-9a53-a672eee2a5ab","resolution":{"observed_at":"2026-08-07T11:18:58.457714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-07T11:18:58.610575Z","title":"arXiv: 2101.03961 [cs.LG]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.610575Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:8e4461a4baab14cdb11cf15b97275b8f37b3eddccfa03f41aeb4dcaa0da79dab","observation_id":"07219901-bb44-4405-a9b3-810c78fad12b","resolution":{"observed_at":"2026-08-07T11:18:58.610575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-03T23:24:43.956833Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-07T11:18:58.768850Z","title":"arXiv: 2211.15841 [cs.LG]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.768850Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:493e449f46c77474b137954c04dea9b1dfbf6afce0f4a867231809913b22128d","observation_id":"55dafae2-588d-4e18-b4ee-64b9a1a0224f","resolution":{"observed_at":"2026-08-07T11:18:58.768850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07524","last_updated":"2025-06-16T02:29:18Z","snapshot_observed_at":"2026-08-07T07:47:25.930763Z","submitted_at":"2024-10-10T01:36:03Z","title":"Upcycling Large Language Models into Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07524","snapshot_observed_at":"2026-08-07T11:18:58.896820Z","title":"Upcycling large language models into mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.896820Z"},"links":{"cited_paper":"/paper/2410.07524","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:360534515b8d1c477581b3f486ccd2075010cdf8cf67381f1d1837aa7011084d","observation_id":"429f91ef-ec6b-419b-85c8-820860df9c47","resolution":{"observed_at":"2026-08-07T11:18:58.896820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:18:59.031902Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.031902Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:12b1b1b3efefd2ed69788d550845ff9ee794170dcaf09f03566ec193e470f4fc","observation_id":"64cd1e7f-79d9-4754-8811-bcb8c29a1841","resolution":{"observed_at":"2026-08-07T11:18:59.031902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T11:18:59.176409Z","title":"Rae, Oriol Vinyals, and Laurent Sifre (2022).Training Compute-Optimal Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.176409Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:0eeff5bf7d8df4856cd3547648ed7f5711c9588c5b7824885a00ea2c2d830c31","observation_id":"f5bb8d47-9b68-4ab0-8272-085aaed78c67","resolution":{"observed_at":"2026-08-07T11:18:59.176409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T11:18:59.337088Z","title":"arXiv: 2401.04088 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.337088Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:32704f912d110a8e679266e058457cd58132718978ff165141a8780a6352bd53","observation_id":"3cc6b99b-984c-4575-914f-684b0cc97be5","resolution":{"observed_at":"2026-08-07T11:18:59.337088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:18:59.465287Z","title":"arXiv: 2001.08361 [cs.LG]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.465287Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:a7e0a4e0e10f2ee782af6ba9888519caf9288859570886dc1bb3d205f5552630","observation_id":"25d45c05-03e1-421c-92cb-edc25657d8e0","resolution":{"observed_at":"2026-08-07T11:18:59.465287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-10T05:40:29.232133Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-07T11:18:59.617737Z","title":"arXiv: 2402.07871 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.617737Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:35ef733dba8cd2a294bab6c1c64d7b9e3a8bcc90b0e60f5818ee36a488ca300c","observation_id":"49c2378d-5ed7-4d2f-a1f9-9e08474a9558","resolution":{"observed_at":"2026-08-07T11:18:59.617737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-07T11:18:59.705154Z","title":"arXiv: 1704.04683 [cs.CL]","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.705154Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:ff80612804d5aa689a6e98ff6d059ddd91dcea46d4c2177a6d3f72d80e51860a","observation_id":"c31a50cf-a3bb-49af-ae73-2a2b94cca90a","resolution":{"observed_at":"2026-08-07T11:18:59.705154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-07T11:18:59.866309Z","title":"arXiv: 2006.16668 [cs.CL]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.866309Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:2411dc66c29fc7581452e948a529e89b9bd10294d67b40c9a9d1a030a91073d5","observation_id":"efaed30b-9103-4d35-8666-f46d2d19fbf2","resolution":{"observed_at":"2026-08-07T11:18:59.866309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T11:18:59.970756Z","title":"arXiv: 2109.07958 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.970756Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:cc37285e07cbf5a405cb4faa2b4dd23bc1053158f91bef9a698df729a5c8ff55","observation_id":"8af221aa-1615-432b-8715-36b997b7a23a","resolution":{"observed_at":"2026-08-07T11:18:59.970756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:19:00.070619Z","title":"arXiv: 1711.05101 [cs.LG]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.070619Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:420c40137c014b1bf9f826c1ba547952fe34fe5d2691f0553a98a43527d0c5e8","observation_id":"6cda30c3-4cf6-4df1-84aa-8c83da93f4b6","resolution":{"observed_at":"2026-08-07T11:19:00.070619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T11:19:00.187903Z","title":"arXiv: 1809.02789 [cs.CL]","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.187903Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:a01e01c7ebba1437d93ef30292be89c2f792db405abb85ad676579718a979231","observation_id":"440298cf-05a8-4c27-9f66-92bad5874d99","resolution":{"observed_at":"2026-08-07T11:19:00.187903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-07T11:19:00.317285Z","title":"Smith, Pang Wei Koh, Amanpreet Singh, and Hannaneh Hajishirzi (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.317285Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:2e7539b5dc94c443417c0f545a11cf586b20e01f7cff1f884196b2edc812553a","observation_id":"09650bda-ab84-413a-ae5a-07c044a036b9","resolution":{"observed_at":"2026-08-07T11:19:00.317285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16819","last_updated":"2024-02-27T15:22:57Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:43:45Z","title":"Nemotron-4 15B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16819","snapshot_observed_at":"2026-08-07T11:19:00.444605Z","title":"arXiv: 2402.16819 [cs.CL]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.444605Z"},"links":{"cited_paper":"/paper/2402.16819","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:652b19b3435f3bc861247941223ab9c23a978bc1891a8287442ffc95c7b64120","observation_id":"8b7bce40-c419-4b8b-8405-e67e9b3de5c6","resolution":{"observed_at":"2026-08-07T11:19:00.444605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-07T09:28:48.845112Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-07T11:19:00.551984Z","title":"Reuse, Don’t Retrain: A Recipe for Continued Pretraining of Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.551984Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:f4fb75cbe7ccb91c2e1c433ea76cac14d6caa91ef191429b3f023e368a011ab2","observation_id":"93099af7-621f-4c4d-adcb-63637862ad55","resolution":{"observed_at":"2026-08-07T11:19:00.551984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-07T11:19:00.673638Z","title":"arXiv: 1907.10641 [cs.CL]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.673638Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:d044209127e50978005f1181bf78a750301c6def82ca29c2f0fc0c941f926bf6","observation_id":"10dac4b0-507a-471a-bde5-a808b18e13b8","resolution":{"observed_at":"2026-08-07T11:19:00.673638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-07T11:19:00.786422Z","title":"arXiv: 1904.09728 [cs.CL]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.786422Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:f0866453af03bd9cfbeb6dc454d1793dd54c068b52a6bb3d9d7496374578b7c9","observation_id":"203ac900-8af4-4aaf-a6bd-317fba9b1f18","resolution":{"observed_at":"2026-08-07T11:19:00.786422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T11:19:00.898089Z","title":"arXiv: 2002.05202 [cs.LG]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.898089Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:e4c7d9295606d8dec33a4028f5d606f581a6fd54bfdadbc7c03defe45219aee5","observation_id":"4f5a9f30-f350-446d-8f03-53eb866f7a82","resolution":{"observed_at":"2026-08-07T11:19:00.898089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T11:19:00.953255Z","title":"arXiv: 1701.06538 [cs.LG]","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.953255Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:b0c1e262bb8a69943a6e7a4de8ecd992a33ce62b8236072d744c776087bf6315","observation_id":"5e5fe9c0-cf6c-4447-83a7-26d75f2bbccd","resolution":{"observed_at":"2026-08-07T11:19:00.953255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T11:19:01.053899Z","title":"arXiv: 1909.08053 [cs.CL]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.053899Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:fddbd400dcc75ccf211dcdfbb829b91884e84807aa3f1e8ce737fb51dd24b648","observation_id":"50cdbd4e-1a64-417c-8797-e52818ce1cc7","resolution":{"observed_at":"2026-08-07T11:19:01.053899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T11:19:01.172988Z","title":"arXiv: 1811.00937 [cs.CL]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.172988Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:88b0448fdad111ccb9010afba43a76f5d5e9d4c118b0a1f437bcd3b29845c403","observation_id":"9df312bc-e8dc-4c7b-b8f8-e54611c79b15","resolution":{"observed_at":"2026-08-07T11:19:01.172988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08245","last_updated":"2024-10-04T03:44:02Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:00:23Z","title":"Scattered Mixture-of-Experts Implementation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08245","snapshot_observed_at":"2026-08-07T11:19:01.275789Z","title":"arXiv: 2403.08245 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.275789Z"},"links":{"cited_paper":"/paper/2403.08245","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:b5ed97ebffcad3121b1093c47b0bfaa937d12ce3f5aac6cb476ce7a95de01c38","observation_id":"78708258-bb64-4aec-a720-da550fee9539","resolution":{"observed_at":"2026-08-07T11:19:01.275789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:19:01.417409Z","title":"(2024).Gemini: A Family of Highly Capable Multimodal Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.417409Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:4b024319b949d4a8e9c5f53d93ea0fb66adca0efe33fe70aa9a6fac246ae2a78","observation_id":"8bbe1ebc-a25d-4c7d-b1eb-2a4650f36c6d","resolution":{"observed_at":"2026-08-07T11:19:01.417409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:19:01.521645Z","title":"arXiv: 2302.13971 [cs.CL]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.521645Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:b1db52f9932909e36179185f441f3dfb81ee431b2998aa8b7456d5b08756a610","observation_id":"880eabab-d2fe-4fb5-93c1-b37eec1aab11","resolution":{"observed_at":"2026-08-07T11:19:01.521645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:19:01.657198Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.657198Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:79c829f9aa5e94ad1f275f05e87d3dc3f63ac8183158b25b2574b9476bd06a53","observation_id":"a206d79e-3f9a-4d15-a308-51b65b513df5","resolution":{"observed_at":"2026-08-07T11:19:01.657198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T11:19:01.798731Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin (2023).Attention Is All You Need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.798731Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:b7f26edd194939c472987799336fbe8d28ecc3efaea4f0f0d2c2a208617766fc","observation_id":"38a7c2ea-f04f-4928-9c37-c87943b8b149","resolution":{"observed_at":"2026-08-07T11:19:01.798731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09952","last_updated":"2024-12-13T08:22:19Z","snapshot_observed_at":"2026-08-07T06:34:06.946381Z","submitted_at":"2024-12-13T08:22:19Z","title":"Llama 3 Meets MoE: Efficient Upcycling","version":1},"cited_work":{"arxiv_id":"2412.09952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09952","snapshot_observed_at":"2026-08-07T11:19:02.624051Z","title":"Llama 3 Meets MoE: Efficient Upcycling","venue":"cs.LG","work_id":"d1ff4c97-878c-42ba-991f-3ad851f07864","year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.925356Z"},"links":{"cited_paper":"/paper/2412.09952","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:ed9b59f7cffac71fc27640120c85c38f14fb06ca115d76cd1cae60abf7ee3f3c","observation_id":"d5f06785-f366-42a5-b461-a7885a63d744","resolution":{"observed_at":"2026-08-07T11:19:02.688225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-03T02:22:36.564849Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-07T11:19:02.046781Z","title":"arXiv: 2408.15664 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.046781Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:56fc083f4e101dbae90611f724197df844c0b99a80cfcbed598e52f5b8fd37d1","observation_id":"5a460349-b136-4297-89aa-e38da0ad669f","resolution":{"observed_at":"2026-08-07T11:19:02.046781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-07T11:19:02.147861Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.147861Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:7ed6582c2ef26fe7e47ce087bc61ea2d0b3fabd16c944f5b1b1dc8ea035e32ef","observation_id":"b2b7a143-d814-4e89-a644-396b9c2b1c69","resolution":{"observed_at":"2026-08-07T11:19:02.147861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T11:19:02.275720Z","title":"url: https://arxiv.org/ abs/1905.07830","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.275720Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:00408b3bc87032a338c6b8e1246ccf6dd10c1ab3dbed9c5f99854ae259dbdfb1","observation_id":"d1927ad0-145f-4822-88e1-84c942b07e31","resolution":{"observed_at":"2026-08-07T11:19:02.275720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-07T11:19:02.406641Z","title":"arXiv: 2202.08906 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.406641Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:f6d16e73e419c10cd9694c4498cdd99bce44dd2c353be721edc66188f2f63299","observation_id":"eeecb256-2e9e-4c02-8725-7200254ac798","resolution":{"observed_at":"2026-08-07T11:19:02.406641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:19:36.325576Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.02890."}