{"as_of":"2026-08-09T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c21454e396fb6ac54ae40d36a89fd8ecc75e7cfc19045c9d34e008d21a040cf4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:15:28.050477Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":31,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-06T22:15:28.050477Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.050477Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:68d0d15c6a1d84bee2d34b913ba336f3708118b99a6cf1719bbecce2cc1a2d22","observation_id":"cc6a1c04-8cc7-41c1-9dfd-bd462064a2e0","resolution":{"observed_at":"2026-08-06T22:15:28.050477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T19:23:15.724137Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12801","last_updated":"2025-08-18T10:25:42Z","snapshot_observed_at":"2026-08-06T02:58:00.222739Z","submitted_at":"2025-08-18T10:25:42Z","title":"Maximum Score Routing For Mixture-of-Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T19:23:15.724137Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2508.12801"},"observation_digest":"sha256:833b4fa9e743d073e143e3865bfc9bcb6463579b0e9da6e8dc4b00e8f0584482","observation_id":"a88dcb9f-1370-4770-8cfa-fd63b42a0f18","resolution":{"observed_at":"2026-08-05T19:23:15.724137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:e6e912a4f07cd1aab6e2a3ce23cba72c3cc4c3d62944fb66a6f78d4e1582a265","observation_id":"ea35a451-8a4a-4010-99dc-292664997f1d","resolution":{"observed_at":"2026-05-18T20:41:50.636452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-04T09:21:47.192671Z","title":"Tutel: Adaptive mixture-of-experts at scale, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.16138","last_updated":"2026-05-29T09:45:22Z","snapshot_observed_at":"2026-08-04T09:21:33.756865Z","submitted_at":"2025-10-17T18:23:01Z","title":"Expert Merging in Sparse Mixture of Experts with Nash Bargaining","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T09:21:47.192671Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2510.16138"},"observation_digest":"sha256:a5b590bb36387def67d93e838c354949055fcf157e31925e4aa8d97836c51dcc","observation_id":"23b236d5-ebbe-4e6f-ad6f-ae384c3c733c","resolution":{"observed_at":"2026-08-04T09:21:47.192671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-03T15:22:50.072145Z","title":"Tutel: Adaptive mixture-of-experts at scale.CoRR, abs/2206.03382, June 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:50.072145Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:611b7c6f748e1a457bb77fc29a7021970324a3808937a5522d2d51f5eb7d77f5","observation_id":"2803a35c-5611-4773-955c-ac98be48f20e","resolution":{"observed_at":"2026-08-03T15:22:50.072145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2604.04750","last_updated":"2026-04-09T14:13:19Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:16:35Z","title":"DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T19:04:17.725111Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2604.04750"},"observation_digest":"sha256:eecd2cc5d9c59ca6226d9de8808aba9c8b5610a30e92f2d076e1c414b7448642","observation_id":"d044f54e-5a55-4f71-a09c-54e4cb1e110b","resolution":{"observed_at":"2026-05-10T23:30:52.194965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2605.05049","last_updated":"2026-05-06T15:47:14Z","snapshot_observed_at":"2026-08-02T19:55:25.393308Z","submitted_at":"2026-05-06T15:47:14Z","title":"Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T17:04:02.418499Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.05049"},"observation_digest":"sha256:d442835f17868c2434fdd71e28182c09bf4beefb36668dfb6dd4d2889a3fd431","observation_id":"586329d9-43f3-4eeb-9591-d10139524a93","resolution":{"observed_at":"2026-05-08T17:13:38.755125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2605.08292","last_updated":"2026-05-08T09:21:46Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T09:21:46Z","title":"Hierarchical Mixture-of-Experts with Two-Stage Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:58:04.218139Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.08292"},"observation_digest":"sha256:c09a14d175e6d7671624a5f7a816391e22ad6a8732189ddd2336a9aa7591f7bd","observation_id":"9763c964-aecc-43c1-a8a5-d3e96f472425","resolution":{"observed_at":"2026-05-12T02:01:15.414453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2605.10670","last_updated":"2026-05-11T14:53:00Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T14:53:00Z","title":"Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:58.729425Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.10670"},"observation_digest":"sha256:1c91a9894958dc686eb53696fd505186c05178dc204db0b66fcf1bcac7380818","observation_id":"bfefe8a1-696b-49c8-880e-73034faa299f","resolution":{"observed_at":"2026-05-12T06:11:24.694697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:e785a0a5f676c630feb9eff4c2dbb3e934e85554b8dfb54119cd04ef7193f964","observation_id":"f2b8a846-bafa-4f14-8e93-07b7e100dc46","resolution":{"observed_at":"2026-05-13T01:52:06.277646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":"arXiv (Cornell University)","work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-02T13:33:38.641735Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T02:11:11.003259Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:f0549a1cc4615585fde7d519b0cb00ec9ac0df0b8aec3037435420ec78540726","observation_id":"9f5d3453-8024-4c6b-802f-0a729e30d43a","resolution":{"observed_at":"2026-05-21T02:13:56.328288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-02T13:33:40.394993Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-02T13:33:38.641735Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T13:33:40.394993Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:828a37b341caae8145a4162a17a27c02a083c611f34ebd2d9d2f77aa0c502df3","observation_id":"b6639421-e5e6-447c-baad-12b98b63baf8","resolution":{"observed_at":"2026-08-02T13:33:40.394993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-07-11T08:35:22.347459Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05116","last_updated":"2026-07-06T14:06:25Z","snapshot_observed_at":"2026-08-02T18:01:37.878392Z","submitted_at":"2026-07-06T14:06:25Z","title":"Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T08:35:22.347459Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2607.05116"},"observation_digest":"sha256:bace30fe5020fdd104ceeecad89b5d926f12018c0eace43dedec7defcb92a475","observation_id":"bdffdf5b-4ce5-40c4-88b7-81450c67042f","resolution":{"observed_at":"2026-07-11T08:35:22.347459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-01T17:32:37.181249Z","title":"Jacobs, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-07T15:41:17.993721Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.181249Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:66f3424e358ac5d0d9c2caeaa45459c999b91b16021f807be7862fbe5d1824ac","observation_id":"1f5b4d38-2a5a-4c5b-9986-7f2b0dbe516a","resolution":{"observed_at":"2026-08-01T17:32:37.181249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-05T00:38:32.858750Z","title":"arXiv:2206.03382","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00574","last_updated":"2026-08-01T10:23:04Z","snapshot_observed_at":"2026-08-07T09:45:34.726642Z","submitted_at":"2026-08-01T10:23:04Z","title":"Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.858750Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2608.00574"},"observation_digest":"sha256:2d48ae19a6d9f62c07276b5d8a88b81ef12c66d6100412283b988e425107a2ce","observation_id":"8899af85-4952-42c0-a0c0-8f99a5dbd38f","resolution":{"observed_at":"2026-08-05T00:38:32.858750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2206.03382/citation-record","integrity":"/paper/2206.03382/integrity","json":"/paper/2206.03382/citation-record.json","paper":"/paper/2206.03382"},"outbound":[],"paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2206.03382."}