{"as_of":"2026-08-14T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd729e047f21946fe178d812f100cb46e1ff2ac848200012caa185a8cc601885","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:08:06.927680Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10605/citation-record","integrity":"/paper/2608.10605/integrity","json":"/paper/2608.10605/citation-record.json","paper":"/paper/2608.10605"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T21:08:06.423069Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.423069Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:5c8121321696f58fbb25d755ddd4f6ec7d257a74cb5921b268639b470707807c","observation_id":"6b237031-4666-4a67-b242-bf83f0093fcd","resolution":{"observed_at":"2026-08-12T21:08:06.423069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T21:08:06.432109Z","title":"arXiv preprint arXiv:2203.15556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.432109Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:2b6afbf56d42f761d09c891287005515ce17666d96626469b76d0fc1b4805790","observation_id":"47491c81-8d8c-428b-afb0-e3be82c0b184","resolution":{"observed_at":"2026-08-12T21:08:06.432109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.437768Z","title":"OpenAI blog , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.437768Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9284b9808a6c304e75cca92f97b12fdc0d75417492322d86b24b58adc36f6431","observation_id":"fde08990-4081-40a3-84c2-fe5d6d5fedf7","resolution":{"observed_at":"2026-08-12T21:08:06.437768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-08-12T23:55:55.131975Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-12T21:08:06.445085Z","title":"arXiv preprint arXiv:2405.18392 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.445085Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8737ae1695541aaf06ac7d9b9ab92cd8b117b6b5c9a723d6810fe273f873207d","observation_id":"861e5366-811d-4e69-be36-4504f6cc5566","resolution":{"observed_at":"2026-08-12T21:08:06.445085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-13T04:20:21.968880Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-12T21:08:06.453774Z","title":"arXiv preprint arXiv:2402.07871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.453774Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:aba4c53eb4c6f9964cbef8a14bf21bc5cde9261c079488fedd9e63d4ead37011","observation_id":"f82952f8-c475-4040-87f5-21e42320667a","resolution":{"observed_at":"2026-08-12T21:08:06.453774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.468088Z","title":"The Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.468088Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b2f2e32ef81566dc9ed39e6eaabeead4247c15492a996bba2320ec50d5385a8f","observation_id":"3e9a04ba-a6c0-4ffc-ab1b-bf1478f0881b","resolution":{"observed_at":"2026-08-12T21:08:06.468088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.476414Z","title":"arXiv preprint arXiv:2602.17004 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.476414Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:238cfa7c900ec93fe5ecdf00dc56d0629d3d6a8ca5bff9ab4a6e329eb52fdb0f","observation_id":"e732c600-88a4-45be-9c2e-75e1102e1db1","resolution":{"observed_at":"2026-08-12T21:08:06.476414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T21:08:06.482664Z","title":"arXiv preprint arXiv:2401.06066 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.482664Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:d5fae8344f862bb8dbc46e4d56a44b28ec8e4483be3f7547aca466d6456f1f0d","observation_id":"90adece7-a22a-4597-8feb-36a4ad71bc70","resolution":{"observed_at":"2026-08-12T21:08:06.482664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-12T21:08:06.491904Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.491904Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:3bd27ee06d85390f1fe266d57022ce823592340037660ec224bbafdc4ea9edf8","observation_id":"1080a66c-5564-40be-8bd3-2f1bb83852a0","resolution":{"observed_at":"2026-08-12T21:08:06.491904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T21:08:06.499520Z","title":"arXiv preprint arXiv:1701.06538 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.499520Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:7402d763864675688dcb3458546d7cd68bab070a83b8c448f036ca16a68dfd2e","observation_id":"7696dc40-8288-4176-876c-614dbc9e2618","resolution":{"observed_at":"2026-08-12T21:08:06.499520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06182","last_updated":"2023-06-18T01:33:19Z","snapshot_observed_at":"2026-08-13T12:27:26.154745Z","submitted_at":"2023-03-10T19:30:15Z","title":"Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06182","snapshot_observed_at":"2026-08-12T21:08:06.509818Z","title":"arXiv preprint arXiv:2303.06182 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.509818Z"},"links":{"cited_paper":"/paper/2303.06182","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:572a21930d15647a56b42781f6b8f2a502cfb11f9ca3d051705ef79690591cff","observation_id":"1b8dfd78-0887-4ef0-8656-8b152fcca41d","resolution":{"observed_at":"2026-08-12T21:08:06.509818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01483","last_updated":"2024-09-02T22:35:03Z","snapshot_observed_at":"2026-08-12T22:52:47.648145Z","submitted_at":"2024-09-02T22:35:03Z","title":"Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01483","snapshot_observed_at":"2026-08-12T21:08:06.516918Z","title":"arXiv preprint arXiv:2409.01483 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.516918Z"},"links":{"cited_paper":"/paper/2409.01483","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:45591eb7f68f7023bfc1c033d24d23d114e92ac39379b3f1d938688657d1ecf8","observation_id":"a8c1dbfc-90ea-4c17-aac4-7fa0e64eaade","resolution":{"observed_at":"2026-08-12T21:08:06.516918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-12T21:08:06.522212Z","title":"arXiv preprint arXiv:1712.00409 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.522212Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:f12d1efd8c967a100de2281b8de801aee7a79c301a7f604d653cd1afd7a47b12","observation_id":"9871cdd8-c02c-4d43-a1a5-40b83cea89cd","resolution":{"observed_at":"2026-08-12T21:08:06.522212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.523251Z","title":"21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24) , pages=","venue":null,"work_id":"d94e1f62-806a-49a4-8bc2-bb913b3216a1","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.532469Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:4aae7df5c39df940d14a54efab01f48f43f82180ba587f996df6adf698ea34fa","observation_id":"e966b2f0-c44c-401f-a2d4-b0cf9dc2c31c","resolution":{"observed_at":"2026-08-12T21:08:08.528755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.505098Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"d31dd71f-3b5a-4da9-b06c-e72b3f6ca022","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.539609Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:654009672fc0befb9dba0533a54c981e6eb03e4a3cee6708714c56207442db58","observation_id":"279fba2c-7251-4635-937a-4a6803670712","resolution":{"observed_at":"2026-08-12T21:08:08.510849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03745","last_updated":"2024-05-13T16:20:29Z","snapshot_observed_at":"2026-08-13T11:23:21.274497Z","submitted_at":"2023-06-06T15:04:31Z","title":"Soft Merging of Experts with Adaptive Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03745","snapshot_observed_at":"2026-08-12T21:08:06.547274Z","title":"arXiv preprint arXiv:2306.03745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.547274Z"},"links":{"cited_paper":"/paper/2306.03745","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9ef474b9bbb0bf2d602770267a8cd0f987eb0f5d385483944172f0e27661e016","observation_id":"c87a1f04-715e-4808-ac78-43a805473548","resolution":{"observed_at":"2026-08-12T21:08:06.547274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.554427Z","title":"Proceedings of the National Academy of Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.554427Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:5f1b1dd0beffd14ef8f9c55a6d70e1e7e2de2a1eabea236eb1c9688594ad3fb0","observation_id":"23f54b16-ca69-4c39-9c8f-3524ca1fb631","resolution":{"observed_at":"2026-08-12T21:08:06.554427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-12T21:08:06.563306Z","title":"arXiv preprint arXiv:2202.08906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.563306Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:24362d7e7369810cca0c687f10cab8790222d36c8f9b924345756eef5454e975","observation_id":"d328b382-a377-4683-9ee5-93f5861a7488","resolution":{"observed_at":"2026-08-12T21:08:06.563306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-13T03:40:31.715335Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-12T21:08:06.569375Z","title":"arXiv preprint arXiv:2010.11934 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.569375Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:4293cc0b9cb49a2e08c6674d4bae73169208f8a55f06132a2b8f6926aee524ef","observation_id":"180b8c83-5844-4a82-a2f3-7387ea466ace","resolution":{"observed_at":"2026-08-12T21:08:06.569375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T21:08:06.577582Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.577582Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:07ad17a1bd3e640438485842515e3f799db490da7db9479d154ef91347335a34","observation_id":"f518dc8b-0d3d-46ed-8094-0ada1d9a1239","resolution":{"observed_at":"2026-08-12T21:08:06.577582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.585378Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.585378Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9701effc5ba51118f85aefb9d699b006f622d967cc8115887629b3088c1f8a1c","observation_id":"3e6274c2-2655-4793-81a4-f6ab3e552ccd","resolution":{"observed_at":"2026-08-12T21:08:06.585378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.591968Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.591968Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8dce7bce83a1d78fd9a0fa49130c2cce4ec1a17b22181dc31742f1e99d6cc575","observation_id":"4da4ec42-e680-45ce-a964-70da5d2d60d5","resolution":{"observed_at":"2026-08-12T21:08:06.591968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.454054Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"68f21655-acb2-492c-bdea-d168e02cda34","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.603038Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:12d9482d8beeeaad44cd47571f020781d78aa0b05b56a2aa5c704e042148e9b4","observation_id":"4956d621-53c3-4deb-9a73-9c60ee34f75f","resolution":{"observed_at":"2026-08-12T21:08:08.459310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-12T21:08:06.610506Z","title":"arXiv preprint arXiv:1909.08053 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.610506Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:6d15086489e4288730a247af95a842694cccfebea5abe9d91900650149c49350","observation_id":"95909ba1-571c-4750-908c-a6bacbad924f","resolution":{"observed_at":"2026-08-12T21:08:06.610506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-12T22:27:39.491552Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-12T21:08:06.618512Z","title":"arXiv preprint arXiv:2410.06511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.618512Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:0434074fb02a5583bd57fcf00b298cd268ea5576458ad011a989360dc35cccf4","observation_id":"b330c79b-3ab7-43f9-adfb-b8cfff00a7ec","resolution":{"observed_at":"2026-08-12T21:08:06.618512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.436245Z","title":"Proceedings of the 37th International Conference on Supercomputing , pages=","venue":null,"work_id":"8911ac53-713b-4b6f-9036-747aea2b4f5b","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.627467Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:06bc61631f96eb9f7afa9c9dd020da4ac31a128590fe12d1333034dff43b6e1c","observation_id":"2db3621f-72dc-441d-9a87-43bf15884b26","resolution":{"observed_at":"2026-08-12T21:08:08.441684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.634827Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.634827Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:730f32e935da5e2c89985d2f09aae650397dcb5c89a5d32faa0771d65232a73c","observation_id":"ddac6e36-ac01-4d02-87b6-98eef57438b9","resolution":{"observed_at":"2026-08-12T21:08:06.634827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.641066Z","title":"arXiv preprint arXiv:2512.16248 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.641066Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b7736aaa7df7f32665b8a4a55e156c3a6e740cbc50ec3eba30b7743be17e91c4","observation_id":"77f763c1-36c8-4566-be38-58849a6bffff","resolution":{"observed_at":"2026-08-12T21:08:06.641066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.406772Z","title":"Proceedings of Machine Learning and Systems , volume=","venue":null,"work_id":"402d1223-6747-4713-98ac-0cb956cefbab","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.647620Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:7c1c84ddea09601edfcc9128fb2d4aa43cc0f6d6e2ac750ad656680af3394d97","observation_id":"1c8a86d5-b17a-40d5-ab96-fa4a01bd3183","resolution":{"observed_at":"2026-08-12T21:08:08.411548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.388572Z","title":"Sparse Backpropagation for","venue":null,"work_id":"ec4cb634-73bf-4e1f-a663-67b44a01d4a6","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.655242Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:3417b103910d8b8d586987769b647a3da8503b2c5e1b9e96a0295d76f23219db","observation_id":"a5bd3903-2a3d-4555-93c5-8ec1ac3ea360","resolution":{"observed_at":"2026-08-12T21:08:08.394469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.372954Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":"c56a8497-3efb-4598-8d10-1c2473659a1e","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.663348Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:24e9b724f7c2d94319e1da317561bc600bcbd13bfbc91b6f42fc119690438f90","observation_id":"79fb29b2-7267-4aea-ab3c-8ec0215c5399","resolution":{"observed_at":"2026-08-12T21:08:08.378260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.355748Z","title":", journal=","venue":null,"work_id":"24469175-ec68-4193-b74c-15e5d7b815b0","year":1977},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.672459Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:c750e0e2974c3490b31c9c0f4c8dc696c32fe31629e52e022dd9909c3ea0223f","observation_id":"f6b20c4f-038b-4fac-93fe-81f5dce1414b","resolution":{"observed_at":"2026-08-12T21:08:08.361176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.334466Z","title":"Stochastic Beams and Where to Find Them: The","venue":null,"work_id":"3142f810-5a20-44c9-9b57-69636f61d1fb","year":2019},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.679677Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:d40bff95a22a7ed94e4d7de18435aea3eb20c64d65a6115f92c3ff0f417f65a1","observation_id":"d3a1d671-822b-4d98-a8ee-48160e81cfa5","resolution":{"observed_at":"2026-08-12T21:08:08.341498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.317170Z","title":"Parameters vs","venue":null,"work_id":"f1fe826b-0478-489e-9183-7722fe4e234d","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.686122Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:1abcbce327646220c71000edbfd55f9b794229cfbcb8ce6b4bc16ba0bde1f62b","observation_id":"25a6391b-18bb-46dd-a4ca-72266ad9a46b","resolution":{"observed_at":"2026-08-12T21:08:08.322797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.297679Z","title":"Optimization and Engineering , volume=","venue":null,"work_id":"f421caa1-fea7-4868-91bb-01f5b73bfa06","year":2007},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.695408Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:469d301af209de8527db5e338dcce5fffdce61627732b262e3005401eef019a4","observation_id":"dd158be4-d9fe-486e-bc92-1ac282baf021","resolution":{"observed_at":"2026-08-12T21:08:08.303510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-12T16:50:37.700290Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-08-12T21:08:06.703997Z","title":"arXiv preprint arXiv:2411.13055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.703997Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:a39a98e0dc40c1a8939c41d058d0d423168fc4f179a485b3fd712719ac316573","observation_id":"a0f4deb9-0b83-40f3-85b5-0ccb76c475eb","resolution":{"observed_at":"2026-08-12T21:08:06.703997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.277064Z","title":"Proceedings of the 53rd International Conference on Parallel Processing (ICPP '24) , year=","venue":null,"work_id":"1aaa2c12-3cd6-485a-a39f-b1b9bbd6c98c","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.711100Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9f921765b6cce3792b5af531b488feabdea8779e9682438443651f6654c67e0f","observation_id":"1a9e5656-4d2f-41ce-a555-973240e861ce","resolution":{"observed_at":"2026-08-12T21:08:08.282981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06589","last_updated":"2025-06-19T06:06:08Z","snapshot_observed_at":"2026-08-10T20:54:48.735590Z","submitted_at":"2025-01-11T17:06:30Z","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06589","snapshot_observed_at":"2026-08-12T21:08:06.717332Z","title":"arXiv preprint arXiv:2501.06589 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.717332Z"},"links":{"cited_paper":"/paper/2501.06589","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:4c11b2fc391f3790d069e92c879809e1a7c7fbc363ecfeb447d8ae7c3c8fdc4c","observation_id":"1f65d64f-35b8-4e10-a7fb-773266371e79","resolution":{"observed_at":"2026-08-12T21:08:06.717332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-12T21:08:06.722936Z","title":"arXiv preprint arXiv:2408.00724 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.722936Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:d98dff5e131a4318463a629ba624107fd552c1b350b948f46905a93a2d717a1c","observation_id":"4feff81c-8e56-4db7-a1ce-7eb0ad1fc118","resolution":{"observed_at":"2026-08-12T21:08:06.722936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.256244Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis (SC) , year=","venue":null,"work_id":"3ab78187-74a0-42a2-bc3c-96a7d0f11014","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.733754Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:08bc9522b897cd1543eab2789673f63a80bea33f0ab65f63a399131c2df9810c","observation_id":"93423d63-cddb-4e3f-aa36-c6a940914633","resolution":{"observed_at":"2026-08-12T21:08:08.261822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.236913Z","title":"2024 57th IEEE/ACM International Symposium on Microarchitecture (MICRO) , pages=","venue":null,"work_id":"4ec0a691-f682-4df0-9b18-7f95952519cb","year":2024},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.742426Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:af8b2e0a401a2c464006c1615e2e53e0743478b6702fb7d85d3d269145130311","observation_id":"449a3ae6-aed0-4dfe-82f8-7be2cdeca79e","resolution":{"observed_at":"2026-08-12T21:08:08.243661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-13T19:29:56.924741Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18107","snapshot_observed_at":"2026-08-12T21:08:06.751426Z","title":"arXiv preprint arXiv:2501.18107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.751426Z"},"links":{"cited_paper":"/paper/2501.18107","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:59a9e1f35d6c3aca3587e61623ec6523460619c99c9366db02eda4f3838e46e7","observation_id":"58850515-0fa4-454f-b1c8-916159b0c19b","resolution":{"observed_at":"2026-08-12T21:08:06.751426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.213557Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient","venue":null,"work_id":"5d4248a2-c172-4f20-b8dc-2ed0e9aaf7f8","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.769078Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:7f077b44dc86740eb5a89b4503d15275cfc00dc863aefe3ae702f58690c9cb74","observation_id":"f0ee2933-cfee-4a90-8d9a-a4220749136a","resolution":{"observed_at":"2026-08-12T21:08:08.221653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.192464Z","title":null,"venue":null,"work_id":"fc77c84d-563b-4904-bd92-612d1ab0c174","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.779225Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:679c73c1cb091ab697ccd4a070cfce6b6066f47b3f04e0bc02b9d9b2de3633c7","observation_id":"60ff314d-10eb-405d-be45-99a8e95fd263","resolution":{"observed_at":"2026-08-12T21:08:08.198270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.174694Z","title":"What Language Model to Train if You Have One Million","venue":null,"work_id":"87baa5c8-9880-4914-8b1e-effbcef26451","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.786185Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:d315af04201ebcaadc2be5b87c60fd53c5f97bc7ed078885576160a014d1ea64","observation_id":"609d2c17-df99-463d-8f5c-aaf46b44a079","resolution":{"observed_at":"2026-08-12T21:08:08.180191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01640","last_updated":"2026-05-02T23:14:20Z","snapshot_observed_at":"2026-08-14T03:13:24.583119Z","submitted_at":"2026-05-02T23:14:20Z","title":"Prescriptive Scaling Laws for Data Constrained Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01640","snapshot_observed_at":"2026-08-12T21:08:06.794872Z","title":"arXiv preprint arXiv:2605.01640 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.794872Z"},"links":{"cited_paper":"/paper/2605.01640","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:49b50433ce2ca5214a42a75c89ec784c098fcf0a332c1334ac1b71df94bea30d","observation_id":"1b3e09af-ea8a-4bc3-996c-aa414ca16d3d","resolution":{"observed_at":"2026-08-12T21:08:06.794872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04800","snapshot_observed_at":"2026-08-12T21:08:06.805052Z","title":"arXiv preprint arXiv:2510.04800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.805052Z"},"links":{"cited_paper":"/paper/2510.04800","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:14f1b488be39ce5468e2aff103628a5bad3743669f9d3dc6172361f4764250ff","observation_id":"84ca1d38-a2d4-4d68-91f9-0eabbd6abe40","resolution":{"observed_at":"2026-08-12T21:08:06.805052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.154425Z","title":null,"venue":null,"work_id":"77acf246-b9e4-4956-88c9-e0a4b96ee52f","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.820167Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:da1d578054602a0e65c9b32a2a179d067231c0e27b6c6f45ad2186a2dd31f270","observation_id":"9083bc53-b9b8-4188-b023-70bcb6f7707b","resolution":{"observed_at":"2026-08-12T21:08:08.159756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21862","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:07.296134Z","title":"arXiv preprint arXiv:2603.21862 , year=","venue":null,"work_id":"4926edd8-afb7-48c6-9dba-e1f71b251f3e","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.833575Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:97a24267686162df65c3b80f8e75bd96d4f0a6ac434f3ae455fc7153ce8de542","observation_id":"f3766a08-927a-4c1c-b9be-a1cdcbc3fd23","resolution":{"observed_at":"2026-08-12T21:08:07.308329Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.133085Z","title":"Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device","venue":null,"work_id":"1e289c3b-ec3c-4fd7-86d9-65bcf2cfe6e3","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.840506Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:ea1f602d8809436958bc5d09d8ca2a1c7e28cb84fb5bcac0305b36c4484ddabf","observation_id":"f62370e6-1b8b-4a82-b630-b3e5a55a2682","resolution":{"observed_at":"2026-08-12T21:08:08.140674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.109178Z","title":null,"venue":null,"work_id":"13da5a71-d6f7-4bd0-9dac-4f5a3117bdd2","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.847152Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9537eec62fa66ec9548c9144fe918773a353c923ede12e019752e8fa08461770","observation_id":"e56bed54-749c-4a9a-a535-93c8abb5bfe6","resolution":{"observed_at":"2026-08-12T21:08:08.117496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.858721Z","title":"arXiv preprint arXiv:2502.06857 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.858721Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:fe5ff7a12858d6d4e78f1e39166f5656709fdb24a060a69f3c6826cee5c91fce","observation_id":"78feed03-83dd-4332-997d-ec02b47a65b2","resolution":{"observed_at":"2026-08-12T21:08:06.858721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-12T21:08:06.867144Z","title":"arXiv preprint arXiv:2505.06708 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.867144Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b2be8faa119ab6fb6577ddb27fac79aedc49382c6c4bfb6a8232fe5727c9146b","observation_id":"d64de1ae-e263-476f-9f40-f3cf22e128d3","resolution":{"observed_at":"2026-08-12T21:08:06.867144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-12T21:08:06.874115Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.874115Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:aaa8e64f02e65fab5e476bc92aa5f9c93080840d464ab472ef45729d2c3dc7ed","observation_id":"c63cd9ad-4e5c-4fa7-959b-c7c60cca800a","resolution":{"observed_at":"2026-08-12T21:08:06.874115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20205","last_updated":"2026-05-21T16:25:08Z","snapshot_observed_at":"2026-08-08T00:53:05.460185Z","submitted_at":"2026-01-28T03:02:30Z","title":"Hyperparameter Transfer with Mixture-of-Expert Layers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20205","snapshot_observed_at":"2026-08-12T21:08:06.883270Z","title":"arXiv preprint arXiv:2601.20205 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.883270Z"},"links":{"cited_paper":"/paper/2601.20205","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:a3328ed5ab7991a864c48e61401c0e077a71b53988bf031df71a385e7ccfe385","observation_id":"f6255afb-ffab-4fd7-9aae-e43673a7f8ca","resolution":{"observed_at":"2026-08-12T21:08:06.883270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.895399Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.895399Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:1cdd8a00fa586996cdd7fda4eb6e8b36d289ffd2394a162997f224b250d6bb2e","observation_id":"6b4c7453-91e9-4953-b27b-1697467ad407","resolution":{"observed_at":"2026-08-12T21:08:06.895399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.908926Z","title":"arXiv preprint arXiv:2603.05451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.908926Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:6857286ccd8df7772614d05719db4bed8a41fea3db093a021a76764e072a37d9","observation_id":"356a404e-2158-4d02-894c-0369c44ee890","resolution":{"observed_at":"2026-08-12T21:08:06.908926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.922488Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.922488Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b2c6de6d1af796242140c4680bed7cfc7660104d20735f1a51e11d89686513b2","observation_id":"2056925c-6285-471d-85d7-73ba10d0eb8f","resolution":{"observed_at":"2026-08-12T21:08:06.922488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.050322Z","title":"Proceedings of the 52nd Annual International Symposium on Computer Architecture , year=","venue":null,"work_id":"f74a34d3-cccd-4c13-9451-0048397176ce","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.927680Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:e39ed96bc163ac452ac4b8333e707cdffd8b642684ecb4d475cf23bdfd0e002b","observation_id":"a46d8889-f46d-4051-b381-b021bfe68bd6","resolution":{"observed_at":"2026-08-12T21:08:08.059996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T11:11:18.720307Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2608.10605."}