{"as_of":"2026-08-19T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29a21cd19d438a1832016b56d54291cc0f8e70dcf9edf07ad0f354c3746b8014","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:46:44.611831Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T04:45:20.091598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T04:49:44.902632Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"cited_work":{"arxiv_id":"2505.06839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.06839","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.06839 , year=","venue":null,"work_id":"07f6ee44-c951-45e0-9fca-d425f9971d21","year":null},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2505.06839","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:6e952ed9b8f0da39250e6602bd40fde346f9ba72df6747473d2d1cba61ec0b1a","observation_id":"78d5c2fa-e4b1-4a29-a7e1-4096c62be107","resolution":{"observed_at":"2026-05-15T04:49:44.905137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.06839/citation-record","integrity":"/paper/2505.06839/integrity","json":"/paper/2505.06839/citation-record.json","paper":"/paper/2505.06839"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-18T17:14:50.507647Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-15T22:46:44.551914Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models.arXiv preprint arXiv:2501.12370,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.551914Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:c45c007756c1370352e2bafdbacfb7c1fd298f1ce920cb78c1153628fed23c50","observation_id":"acb9d570-262b-4ae3-b445-d43529f4ac24","resolution":{"observed_at":"2026-08-15T22:46:44.551914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4314","last_updated":"2014-03-09T20:15:03Z","snapshot_observed_at":"2026-08-14T23:51:33.057411Z","submitted_at":"2013-12-16T11:15:10Z","title":"Learning Factored Representations in a Deep Mixture of Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4314","snapshot_observed_at":"2026-08-15T22:46:44.562756Z","title":"Learning factored representa- tions in a deep mixture of experts.arXiv preprint arXiv:1312.4314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.562756Z"},"links":{"cited_paper":"/paper/1312.4314","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:65908b7384c450b8b5c0a318d1a647941e7ef2b18dc84621610a7649d1a46408","observation_id":"3fd8071f-9a3c-41f4-8380-989a19baa200","resolution":{"observed_at":"2026-08-15T22:46:44.562756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-17T15:59:54.117281Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-15T22:46:44.567757Z","title":"Mixture of a million experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.567757Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:ef324c2cdae7ceb1ca0b95e03e2d9c26110c217fd201130441ecf31061706e7d","observation_id":"a372c26e-c605-497b-a2c7-f733c157d218","resolution":{"observed_at":"2026-08-15T22:46:44.567757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:46:44.593031Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.593031Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:b140c977255fe95f0e402c6f73266cc0af40174603221016240e74ad3311ec1d","observation_id":"83593f7e-03f4-4f89-a214-4fc73c2f7b6e","resolution":{"observed_at":"2026-08-15T22:46:44.593031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02852","last_updated":"2024-04-03T16:33:42Z","snapshot_observed_at":"2026-08-18T12:11:27.086053Z","submitted_at":"2024-04-03T16:33:42Z","title":"Toward Inference-optimal Mixture-of-Expert Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02852","snapshot_observed_at":"2026-08-15T22:46:44.611831Z","title":"Toward inference- optimal mixture-of-expert large language models.arXiv preprint arXiv:2404.02852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":1937,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.611831Z"},"links":{"cited_paper":"/paper/2404.02852","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:e287bbf89e29d2d47ef6374cd163f02377368f91d464d1064673f0c3e1573a53","observation_id":"f8f91383-0e61-458f-851a-3e6491fc3c03","resolution":{"observed_at":"2026-08-15T22:46:44.611831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19034","last_updated":"2025-03-01T03:53:04Z","snapshot_observed_at":"2026-08-18T12:11:46.637581Z","submitted_at":"2024-10-24T17:54:41Z","title":"Mixture of Parrots: Experts improve memorization more than reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19034","snapshot_observed_at":"2026-08-15T22:46:44.572961Z","title":"Mixture of parrots: Experts improve memorization more than reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.572961Z"},"links":{"cited_paper":"/paper/2410.19034","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:bee6e300abefee835b00131384ad0f751afb2ffd66080e50327a610f78950920","observation_id":"51fcda39-e0ee-4794-ac27-0da723f76ce2","resolution":{"observed_at":"2026-08-15T22:46:44.572961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T22:46:44.606998Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.606998Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:d075c3daef0b5c2715b47dd8072d58b3bf8dd32d10805ff5c418050e12d258c7","observation_id":"19f5b74c-cf85-4805-8ab5-0415fdb0cfbb","resolution":{"observed_at":"2026-08-15T22:46:44.606998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13999","last_updated":"2023-10-24T03:41:37Z","snapshot_observed_at":"2026-08-18T22:20:44.764532Z","submitted_at":"2023-05-23T12:28:37Z","title":"Towards A Unified View of Sparse Feed-Forward Network in Pretraining Large Language Model","version":3},"cited_work":{"arxiv_id":"2305.13999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13999","snapshot_observed_at":"2026-08-15T22:46:44.702415Z","title":"Towards A Unified View of Sparse Feed-Forward Network in Pretraining Large Language Model","venue":"cs.CL","work_id":"6e19c1b7-f2ba-420b-9eab-7eb7b9d0a3b9","year":2023},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.597671Z"},"links":{"cited_paper":"/paper/2305.13999","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:6b4afcb2ce98a95dd14255f01a6b9e515680aac5ef9cb57a14aa32fb983e0ea8","observation_id":"853018b4-d263-488b-a4ad-4f2f03a88d57","resolution":{"observed_at":"2026-08-15T22:46:44.710594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-15T22:46:44.557649Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models.arXiv preprint arXiv:2401.06066,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.557649Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:7812c5d25e02e9b457d4dea4d3b805b72c30ddf8f4f348be77cbd372488da476","observation_id":"7ce640f6-c721-4693-89fe-c8983745d0dc","resolution":{"observed_at":"2026-08-15T22:46:44.557649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T22:46:44.602434Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.602434Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:330c54ae1756f697d8bf9d7575cb5bf7c8166297a5e8f2b387e41ae4c6fd6f1b","observation_id":"af40d205-c36f-4223-a4d9-fe8c05e1f3ea","resolution":{"observed_at":"2026-08-15T22:46:44.602434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T22:46:44.578388Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.578388Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:d6ca342ca24e8668f7a82e52dcbdafb93b5926592012fbecd3a76da64cdc5d9d","observation_id":"6a1667a6-f474-45fc-89d6-c299ce6083d5","resolution":{"observed_at":"2026-08-15T22:46:44.578388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-18T12:11:18.333774Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-15T22:46:44.587867Z","title":"Scaling laws for fine-grained mixture of experts.arXiv preprint arXiv:2402.07871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T22:46:44.587867Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2505.06839"},"observation_digest":"sha256:34710e34c01c3c108cacc612c7c348b062bcfc728ba0b53ea76047291804e320","observation_id":"cb3e4a9c-6470-4949-a038-3f529b28ba10","resolution":{"observed_at":"2026-08-15T22:46:44.587867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.06839","last_updated":"2025-05-11T04:35:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T12:12:02.040339Z","submitted_at":"2025-05-11T04:35:40Z","title":"The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2505.06839."}