{"as_of":"2026-08-11T21:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ac507814679eb4ab71a6739d62507b62859607364e75a71d26c4b019e52de32","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:20:00.625923Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:15:48.899045Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:07:44.019959Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2605.23764","last_updated":"2026-06-01T05:30:13Z","snapshot_observed_at":"2026-08-02T20:06:32.213238Z","submitted_at":"2026-05-22T15:35:23Z","title":"HyperParallel-MoE: Multi-Core Interleaved Scheduling for Fast MoE Training on Ascend NPUs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T02:49:09.109990Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2605.23764"},"observation_digest":"sha256:2fcfae7911b1d8c391537ad13651a3990a7f34731b60194e9a2344443ee8fe24","observation_id":"d48fd47b-27d9-4071-ab35-5fcddb1f043f","resolution":{"observed_at":"2026-05-25T02:55:16.740757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2605.23764","last_updated":"2026-06-01T05:30:13Z","snapshot_observed_at":"2026-08-02T20:06:32.213238Z","submitted_at":"2026-05-22T15:35:23Z","title":"HyperParallel-MoE: Multi-Core Interleaved Scheduling for Fast MoE Training on Ascend NPUs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T15:10:25.071087Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2605.23764"},"observation_digest":"sha256:f9234ea192b633a4118731e380a39a48f3f3f3251b98cd0c0963e73b7e5ca597","observation_id":"5aa9ec18-b6ca-4b5e-bed4-515bbe1a9efd","resolution":{"observed_at":"2026-06-30T15:14:46.920212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2607.06202","last_updated":"2026-07-08T01:17:01Z","snapshot_observed_at":"2026-07-31T18:13:20.224549Z","submitted_at":"2026-07-07T12:25:16Z","title":"UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-08T13:43:17.950000Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2607.06202"},"observation_digest":"sha256:762adb28503407222e2061ecdbda12f5ee40dc424a94df0e781db712b971c48c","observation_id":"f3be937e-2cbe-441f-aba0-308989d8ae18","resolution":{"observed_at":"2026-07-08T13:44:54.959728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2607.06202","last_updated":"2026-07-08T01:17:01Z","snapshot_observed_at":"2026-07-31T18:13:20.224549Z","submitted_at":"2026-07-07T12:25:16Z","title":"UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T01:06:46.426582Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2607.06202"},"observation_digest":"sha256:7e110b600bc3a01fd5ef540202a81d65e7e1d56f3576c2d91910e9ebc83e5a99","observation_id":"a95939fd-7d5f-4ca2-a4a0-cfb70e2bfb7e","resolution":{"observed_at":"2026-07-11T01:07:44.052559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-08-01T00:15:48.899045Z","title":"Uniep: Unified expert-parallel moe megakernel for llm training.arXiv preprint arXiv:2604.19241, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26316","last_updated":"2026-07-28T22:25:41Z","snapshot_observed_at":"2026-08-11T01:34:25.846640Z","submitted_at":"2026-07-28T22:25:41Z","title":"Route-Block Membership Selects Packed-AWQ Arithmetic: A Controlled Single-Fixture Mechanism Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T00:15:48.899045Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2607.26316"},"observation_digest":"sha256:3b4647ee383a62a648d3bc43ce16929ad7dbb762ce788c58bf3ef76eda442b11","observation_id":"c9d599b9-36c8-4d1f-a50a-b2255d0f2a21","resolution":{"observed_at":"2026-08-01T00:15:48.899045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19241/citation-record","integrity":"/paper/2604.19241/integrity","json":"/paper/2604.19241/citation-record.json","paper":"/paper/2604.19241"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:bb727ba1ff0a319151498411009e56848f9fbefb843b9f128fe32d599c3a52ab","observation_id":"66da6c2a-8253-448c-90bc-d1da9e8aac1e","resolution":{"observed_at":"2026-05-11T13:06:05.187960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:191bb23003a5611c2ba4ddbe5979a57d128a2820a63045e071c9fbdb0fb72e78","observation_id":"7b8c0ef6-f223-4c54-b625-3e2e11f521ed","resolution":{"observed_at":"2026-05-10T12:48:40.999279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:3ead709fef2f37be0d879f9a8ac8478dc3e29265a9dd8742d0e78e92460c081c","observation_id":"ffe8079c-8fd9-4c9a-a816-aab4f65cdc85","resolution":{"observed_at":"2026-05-10T17:49:28.234076Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7801.344162","doi":"10.1145/3437801.3441620","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sid-Lakhdar, Osni Marques, Xinran Zhu, Chang Meng, James W","venue":null,"work_id":"73714688-414c-4bae-96fe-9be1d689d045","year":2021},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:c09f9684c15f087a198b490833ce675c54cb0dabc8617b3585d2490c3c38d696","observation_id":"910f05ab-7cef-48c3-8bba-b180ff9a316a","resolution":{"observed_at":"2026-05-10T02:22:20.753701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-07T05:35:13.505081Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":"2406.06858","doi":"10.48550/arxiv.2406.06858","metadata_source":"pith","pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flux: Fast software-based communication over- lap on gpus through kernel fusion.arXiv preprint arXiv:2406.06858","venue":"cs.LG","work_id":"5d0e6adc-6dd2-49cc-8551-dc00433ed79f","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:520e67f5d12ea4c0e4faacb8cfb026cbf0d250cac782c16eeba6fe837cc077e6","observation_id":"07f0e3c7-1f59-4311-8ea7-3f5818b42a26","resolution":{"observed_at":"2026-05-10T02:22:20.756427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0666.365137","doi":"10.1145/3620666.3651372","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dtc-spmm: Bridging the gap in accelerating general sparse matrix multiplication with tensor cores","venue":null,"work_id":"cef5f8d1-2227-425b-8638-704a0f51b889","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:cde8dcae044bd0db1da46dc74292000ae445cf7aabb1d0ea22531e3cf3596841","observation_id":"771d797e-eda7-40e0-86a8-aae9ec9c5309","resolution":{"observed_at":"2026-05-10T02:22:20.748411Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yan, Haichen Shen, Meghan Cowan, Leyuan Wang, Yuwei Hu, Luis Ceze, Carlos Guestrin, and Arvind Krishnamurthy","venue":null,"work_id":"bf7548c5-23a4-4839-925d-6214b99a581a","year":2018},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:91b5c0118daf4c18350ec22940ac91e82c8bbdc09e59b5be20d9a3fdf6bfaa67","observation_id":"78b4c38a-26e9-4ccf-9da0-c33aca6dd0b3","resolution":{"observed_at":"2026-05-22T22:55:12.836724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11840","last_updated":"2022-07-19T21:02:48Z","snapshot_observed_at":"2026-07-06T12:32:03.397176Z","submitted_at":"2022-01-27T22:54:59Z","title":"GC3: An Optimizing Compiler for GPU Collective Communication","version":3},"cited_work":{"arxiv_id":"2201.11840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.11840","snapshot_observed_at":"2026-07-02T00:56:25.195580Z","title":"Gc3: An optimizing compiler for gpu collective communication","venue":null,"work_id":"b4cb043a-ed8e-4cae-a668-1047bd650abe","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2201.11840","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f265ef6b6af85af57b016baf7656646555feae2c8bc351b61cae4c23e015101d","observation_id":"f5d1cdc7-da21-4abd-8040-cb29f965e972","resolution":{"observed_at":"2026-05-11T13:06:05.130784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":"2205.14135","doi":"10.48550/arxiv.2205.14135","metadata_source":"pith","pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":"cs.LG","work_id":"efa96825-0830-4cfc-a250-fdaf6af302ab","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:238a359ddfc620703e2159a503d0f77eef08f91e9194f45aa15732969b809cf6","observation_id":"9910f007-77b5-4f4b-8e46-21b7e701b973","resolution":{"observed_at":"2026-05-12T16:22:09.323619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3 pro: Best for complex tasks and bringing creative concepts to life","venue":null,"work_id":"5cd10c49-cdd7-4a0d-bfa4-d2ab2605ee6e","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:a43d79a5face39686521597f4e1e94d9d8b750acd468c62ee5c3b638ef14a466","observation_id":"47e2ec53-b33d-4dda-a4ee-7fceb129e196","resolution":{"observed_at":"2026-05-22T22:55:12.778932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek deepgemm.https://github.com/deepseek-ai/DeepGEMM","venue":null,"work_id":"50966009-788a-41cc-b32a-d0ab061efe3b","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:ab2bad90d2129d2d3fff103a557bd8b036fbf1f14981ac3710a3ce5d3815d36d","observation_id":"94199d36-dc3e-422c-a228-9b211b633178","resolution":{"observed_at":"2026-05-22T22:55:12.775098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EPLB: Expert parallelism load balancer.https://github.com/deepseek-ai/EPLB","venue":null,"work_id":"8614c155-81c4-4a73-89ab-5203fc33d492","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:40eebf4ee4136b322613824ebeb5ae73f8f3fc59b8466729e4990985ca738ca5","observation_id":"c9c0a81e-f413-4a95-a08f-a5f12a14cd8a","resolution":{"observed_at":"2026-05-22T22:55:12.829774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:b3f906e636e749e975607bce53af0f47011c1e7010fb99a6f3930eb18e780320","observation_id":"13b002bd-403a-4464-a425-b21586977825","resolution":{"observed_at":"2026-05-10T02:22:20.745599Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:9284bfe17719ff67463ecad453ed56c7e5ba71a60422c454672bf24bc1f7b210","observation_id":"628cb1b5-64df-40d5-9e69-67b8842768e2","resolution":{"observed_at":"2026-05-11T05:36:27.707517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:95d7ce7f2a863f9ad5a0e7b99c2252f867f7e634d463e51dd6cab73410d04825","observation_id":"380db4b4-2128-4070-969b-2915da0c2679","resolution":{"observed_at":"2026-05-10T02:22:20.777223Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megablocks: Efficient sparse training with mixture-of-experts","venue":null,"work_id":"45e62493-53dd-462d-9cb9-fb271d1748dc","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:cb3a5397c5612845c22cc45b7082b08fd8a7c20996ea29683530aea5a7097b0f","observation_id":"4b2e0c17-39bf-4900-9792-037f915bec17","resolution":{"observed_at":"2026-05-22T22:55:12.801668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":"8d0e45d6-6c50-4bff-8812-1e9c8793be32","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:c2aaf48a35d07d81ca9dc8313880e735606af4a188b5e6a74f300ee8e48312c7","observation_id":"13d1e92c-5aad-42e2-8675-6aaec65d3323","resolution":{"observed_at":"2026-05-22T22:55:12.816689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3222.350777","doi":"10.1145/3503222.3507778","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 9781450392051","venue":null,"work_id":"a7bdb303-6f9e-48de-a5a4-2ab95f68f24f","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:3e2932382f306bd0ab6e28a433f8c088bd6b3d8b39f727b234fc53f578f50303","observation_id":"36a3c88b-7e5a-4c57-a0a4-36ffe714ffa5","resolution":{"observed_at":"2026-05-10T02:22:20.772321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11432","doi":"10.48550/arxiv.2505.11432","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:43.805821Z","title":"Megascale-moe: Large-scale communication-efficient training of mixture-of-experts models in production","venue":null,"work_id":"d2e5a111-b10c-463f-8ca7-b88ca8a6ff29","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:78da171c773457e847df96afc565a8cc85b916cc7135a4853370bd3bba9ab62e","observation_id":"c8233072-779d-42b2-90e7-637e2e63a33a","resolution":{"observed_at":"2026-05-10T02:22:20.792865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:bc02d503357c479accb0067fb380c53b8261ed29640c42251a80298a24226929","observation_id":"cdc58660-fb0f-4d37-8ca1-a3b6209b69d2","resolution":{"observed_at":"2026-05-10T02:22:20.785190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-07T00:12:09.462694Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":"2410.06511","doi":"10.48550/arxiv.2410.06511","metadata_source":"pith","pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liang, T","venue":"cs.CL","work_id":"d5bcdcf7-c2fd-424d-899d-ee194fbc6266","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:d186b829686b7a35418052f38a376d15f546d9f674cd3e06191a3b14b9e888e1","observation_id":"1175d644-e51a-49f6-a538-8ff8ed301a29","resolution":{"observed_at":"2026-05-11T13:06:05.145883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Netmoe: Accelerating moe training through dynamic sample placement","venue":null,"work_id":"2989296b-5a6f-4340-8553-032c5cc8dde4","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:ef04f5d8b74dc16e9ec5f347c8b688f2de75a33a7676c8d461955ef5a0cb01cb","observation_id":"df5c352b-b3b6-4374-a2d2-eda39f20e0d2","resolution":{"observed_at":"2026-05-22T22:55:12.826544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:9d3c5684893b3e4cd248bc3450e30c1ce8ae8cf866d251d1a45be1d8b64f329d","observation_id":"468dc8cd-76d3-4096-a1e4-0501c6f32fed","resolution":{"observed_at":"2026-05-11T17:58:54.896552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large-scale language model training on GPU clusters using megatron-lm","venue":null,"work_id":"385a9a03-8525-4c2a-aa4e-2b8e95c452b8","year":2021},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:b5fa1ce47cee76ef7a05a3d44f58ce2ac10f916bf858c2deb397d62d77859e33","observation_id":"8e6b96f6-3b73-4f09-bc9b-d6f8452dec97","resolution":{"observed_at":"2026-05-22T22:55:12.795542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8817.347620","doi":"10.1145/3458817.3476205","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =","venue":null,"work_id":"65666e92-1679-4e6b-831b-29afb00b2254","year":2021},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:85881582d1ea90b2c351a661817e20489193b65b91705980764ec0d022260c40","observation_id":"c619b48e-c2da-44cb-9325-148fce09a6b2","resolution":{"observed_at":"2026-05-10T02:22:20.764122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"cuBLAS","venue":null,"work_id":"42c693b1-ab4c-4f45-a2de-429fbccfeba6","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:c831d1b849c5a81ecd24d1e8dcf672e203b5ff4064bed6b178116813e2dcffb5","observation_id":"ab7678e8-03c7-44cc-a8e9-ec61309cf81b","resolution":{"observed_at":"2026-05-22T22:55:12.798348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cutlass","venue":null,"work_id":"fa4b9877-af26-419a-b775-61d7c42d0117","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:88cc3c6b6912e60a42ca38574ed2b709512f2404e711040d8894bcc8d38131f8","observation_id":"e148596f-810e-4815-bb3e-248b7bf567b9","resolution":{"observed_at":"2026-05-22T22:55:12.792629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer Engine","venue":null,"work_id":"6e488947-ec40-41d6-8ec1-b5868f7e0fa2","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:dfbabaeee935307889c3d9a06394106375b3b1f27dd0852272ba9b110407e9d1","observation_id":"094117ac-38db-4cea-b24e-266bfe990cbc","resolution":{"observed_at":"2026-05-22T22:55:12.785435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvidia collective communications library.https://developer.nvidia.com/nccl","venue":null,"work_id":"7abc84ab-698d-40cc-a047-35be93b57989","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:aed67f35d49b358a9231ae3f39580fe70b51d1813506b4aef92428d92a6ef12d","observation_id":"46d1206e-8468-49f5-a5ba-ed06f8da8f1a","resolution":{"observed_at":"2026-05-22T22:55:12.833907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVSHMEM","venue":null,"work_id":"8b385ec5-7d92-46b6-aea7-391f8d12f786","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:602425dffd8e45f89c07b838737551878fd0206d69ee488e3cf2f5764890ba07","observation_id":"e8a0f742-0bce-4c4e-9b8d-1bfbd8a73121","resolution":{"observed_at":"2026-05-22T22:55:12.813695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cudnn","venue":null,"work_id":"a167c2b1-d3cb-4bcb-a649-bba9ab097823","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:16631183f9a0c5942deb2027397e7c81700c4d2f4adce46dff3b6aa3cba921c6","observation_id":"951a7b2d-116a-4386-9b50-2517f7535b63","resolution":{"observed_at":"2026-05-22T22:55:12.820327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cutile","venue":null,"work_id":"3a21850d-5c4f-462a-a7a3-f510f666f0aa","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:8944847b478e3e082ae881d63e126164911b8a54770878c12acf17fe240e346b","observation_id":"4658d62d-678c-48d1-8b22-29e16d82ef1f","resolution":{"observed_at":"2026-05-22T22:55:12.810611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1956.246217","doi":"10.1145/2491956.2462174","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In Proceedings of the 34th ACM SIGPLAN Conference on Programming Language Design and Implementation (Seattle, Washington, USA) (PLDI ’13)","venue":null,"work_id":"5fff4b76-ab05-4380-820d-d41e0e052e06","year":2013},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f72eca1dbbad47620b2e697e13d88f0d771018c008b11918f032986a89d249bb","observation_id":"75f7aef6-ff81-4635-b35a-57928430dca9","resolution":{"observed_at":"2026-05-10T02:22:20.769286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation AI scale","venue":null,"work_id":"94dff17c-09ac-45f1-9c71-0bfda63d2f81","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:9f65ecef9434a414a0ae21c1bbc86858a566068ea34d8f43cf75b4395d8823e7","observation_id":"42fd1dae-0226-49cf-99b3-58636af2d7fb","resolution":{"observed_at":"2026-05-22T22:55:12.823485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TACCL: guiding collective algorithm synthesis using communication sketches","venue":null,"work_id":"de90f3d2-de7d-4987-b754-9ebeb4ebe2f4","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:ab871f9a1f477b00b0d1ab575a258b8e744b20764f4f5451c6af9733f0cfa1fa","observation_id":"a89c9baf-3daf-43a5-91ab-27f9b8ac00d8","resolution":{"observed_at":"2026-05-22T22:55:12.782565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.09014","doi":"10.48550/arxiv.2504.09014","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"13 Msccl++: Rethinking gpu communication abstrac- tions for cutting-edge ai applications","venue":"arXiv (Cornell University)","work_id":"7a05854d-4064-4fef-902a-6ecb1680de1c","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:333b75cd18dfc26ceda1096428301ee4533396356ba6ef643cb1b65bc55cf76a","observation_id":"ae709182-f79a-4b0d-bd49-57fd5248c1ba","resolution":{"observed_at":"2026-05-11T13:06:05.160837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:b60ba0d8bfbc107e1430616529281ba16ddddc04d746137d554e1b52cba162c0","observation_id":"1fd23176-d698-4b43-b71c-2e2896b225dd","resolution":{"observed_at":"2026-05-11T13:06:05.091271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look ma, no bubbles! designing a low-latency megakernel for LLAMA-1B.https://hazyresearch.stanford","venue":null,"work_id":"bfa8f3e0-a500-49ef-a15a-f7f057a2c21f","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:a389dc9725b3df31424e5e075f0712238f3ec38c35fcc9880e14d1f94a79ead9","observation_id":"162f04d2-a0cf-4723-a9c3-dfae7f341d36","resolution":{"observed_at":"2026-05-22T22:55:12.840033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tilelang","venue":null,"work_id":"06813f55-1c5f-4613-b157-b781fb2c374b","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:a908a8cc1165d006297b7e11ea6b19f8824831706d47918048ff4f3766521abc","observation_id":"9c6593ea-dde3-49fc-bad7-71e36d02c808","resolution":{"observed_at":"2026-05-22T22:55:12.804445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5508.332997","doi":"10.1145/3315508.3329973","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"T., and Cox, D","venue":null,"work_id":"36502ac3-807e-4ab8-ac44-c87017160e32","year":2019},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f961882105e345e66ae431f87ef41331c27231b434aea23334a22fd6bd4fd25d","observation_id":"4d9a3f9d-d4b2-4089-8bc0-5145c73b963b","resolution":{"observed_at":"2026-05-10T02:22:20.782611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:49:01.192843+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:49:01.192843+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.727485Z","title":"Deepseek-ocr 2: Visual causal flow","venue":null,"work_id":"9886dce9-776e-4ad6-b96c-fbf9037ca41c","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:7f527c9d541955ca9dcb4cf14027554ee29e31eb43896f10cda50cf6d353f995","observation_id":"70424c11-e580-4bfb-8637-cc2755e560e2","resolution":{"observed_at":"2026-05-11T13:06:05.154892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mirage: A multi-level superoptimizer for tensor programs","venue":null,"work_id":"99ec650a-994c-4473-9468-eb8d50f98dd4","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:220062042c01cc3a76f663c7ef7e1f50ed8389e1a0acc7e5733c6f1b45dc484a","observation_id":"001275b3-50c1-4502-8acd-9c55eb7af1a1","resolution":{"observed_at":"2026-05-22T22:55:12.807709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03871","last_updated":"2025-04-04T18:55:52Z","snapshot_observed_at":"2026-08-07T16:08:35.514841Z","submitted_at":"2025-04-04T18:55:52Z","title":"HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs","version":1},"cited_work":{"arxiv_id":"2504.03871","doi":"10.48550/arxiv.2504.03871","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HeterMoE: Efficient training of mixture-of-experts models on heterogeneous gpus","venue":"ArXiv.org","work_id":"d1a5f223-4c92-416a-8bdd-1545f0ca369b","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2504.03871","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:15c3a95ab595becc428d5b0fc775c57cb37ea0f42d6b44b5f987e8ef98fe2659","observation_id":"8d7c778e-2d3e-43e1-a02c-b76f054756b3","resolution":{"observed_at":"2026-05-10T02:22:20.798325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:24:51.239515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:24:51.239515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:094809be9148e10370c4703a1c8631879fe8a3c47273c183036fe7e0e3bca383","observation_id":"142864b2-7607-46bb-8820-533d0697d3fb","resolution":{"observed_at":"2026-05-10T02:22:20.787842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19470","doi":"10.48550/arxiv.2510.19470","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hybridep: Scaling expert parallelism to cross-datacenter scenario via hybrid expert/data transmission.CoRR, abs/2510.19470","venue":"ArXiv.org","work_id":"1654cca3-5615-4233-9af6-809347833f2a","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:11bd7d5826e5e537b0f7b53a3fdd0ad422ae48f3d45de173121eb393ccfe6f99","observation_id":"5dbe25a5-b271-4c12-b37a-bcb711a1a898","resolution":{"observed_at":"2026-05-10T02:22:20.780202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":"2501.01005","doi":"10.48550/arxiv.2501.01005","metadata_source":"pith","pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","venue":"cs.DC","work_id":"a153885b-2460-4177-9053-8d0011adfcb9","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:a1ef6dbb9c9596020966df492275aa7527db7188c57af41dcd0fea940966d12b","observation_id":"a56ece74-955e-488a-81e0-21a99ec07a7c","resolution":{"observed_at":"2026-05-16T13:26:34.840430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moeblaze: Breaking the memory wall for efficient moe training on modern gpus","venue":null,"work_id":"ac2916b2-7e80-4307-ac1e-54bc27ad57ae","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:4bec4759a0eb97f6d5d63faad21ebb1baec09cff879cf014536fbb0952b214e5","observation_id":"314cc047-63c7-4e6e-98a2-028d0fcc62fd","resolution":{"observed_at":"2026-05-11T13:06:05.100544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19811","last_updated":"2025-03-04T09:54:37Z","snapshot_observed_at":"2026-08-10T03:33:57.558104Z","submitted_at":"2025-02-27T06:36:45Z","title":"Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2502.19811","doi":"10.48550/arxiv.2502.19811","metadata_source":"pith","pith_arxiv_id":"2502.19811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Comet: Fine-grained computation-communication overlapping for mixture-of-experts.arXiv preprint arXiv:2502.19811","venue":"cs.DC","work_id":"fd582629-4ba6-4562-ac30-4d015f0d1886","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2502.19811","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:a36dc5b00ff54b6dbf66bb123f77a75c339587f29c37b251c9ad854f60bfc29a","observation_id":"a66710f6-37a0-466c-82b1-ea015a73c01f","resolution":{"observed_at":"2026-05-10T02:22:20.774941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:ff957e3bd9e26f0b9fa6e91c7e4672b7f3bf8f03d94139d061b20bf693e05ce8","observation_id":"689b5af6-e7a3-48db-8b59-6c774e36567a","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepep: an efficient expert-parallel communication library.https://github.com/deepseek-ai/ DeepEP","venue":null,"work_id":"b6554de8-b892-4333-8b51-f93d0e52f1ac","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:2a5dddeb82a2962bb748c11ea75533191f1784506c123a8ab37d526ccecc09f0","observation_id":"f33ca7f4-8bc4-40e8-94b9-493731ae88c2","resolution":{"observed_at":"2026-05-22T22:55:12.789393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19442","last_updated":"2025-06-05T05:48:26Z","snapshot_observed_at":"2026-08-07T15:58:44.558772Z","submitted_at":"2025-04-28T03:09:22Z","title":"Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler","version":3},"cited_work":{"arxiv_id":"2504.19442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19442","snapshot_observed_at":"2026-07-03T07:37:44.599691Z","title":"ISBN 9798331314385","venue":null,"work_id":"f063ecaa-699c-4559-bbba-cd25b4712df7","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2504.19442","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:22f8878beb7cd1fbe1061ad0b2945167ae7b25b57ae694af54e64ac5ad3b66a9","observation_id":"3ad8e02c-cd63-41e6-a347-8849af033675","resolution":{"observed_at":"2026-05-11T13:06:05.137902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20313","last_updated":"2025-04-03T10:23:19Z","snapshot_observed_at":"2026-08-07T16:36:18.156058Z","submitted_at":"2025-03-26T08:25:12Z","title":"TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives","version":3},"cited_work":{"arxiv_id":"2503.20313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20313","snapshot_observed_at":"2026-07-03T03:37:35.982504Z","title":"Tilelink: Gen- erating efficient compute-communication overlapping kernels using tile-centric primitives","venue":null,"work_id":"376b5de0-d796-4431-bbd6-101693b92d95","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2503.20313","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:d28813b52642e1c5e2d79566621d606f617662f5f8400a3faa2bf7af86ae1faf","observation_id":"bcbaa556-f5f3-49e8-92a6-29a89e3e840b","resolution":{"observed_at":"2026-05-11T13:06:05.170224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-08T01:33:26.740871Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":"2504.02263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-07-11T01:57:51.799355Z","title":"In19th USENIX Symposium on Operating Systems Design and Implementation (OSDI 25), pp","venue":"cs.DC","work_id":"26883f2e-5380-48d4-bfe3-a68b38b39a08","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:8f084fc971726c077e079505988e6cff7bf895f107d8e614cd356fa0ba005c33","observation_id":"5ccfd899-b6aa-43a5-874e-954b84295ffe","resolution":{"observed_at":"2026-05-11T13:06:05.120260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":16,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":21},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 5 inbound Pith citation observations for arXiv:2604.19241."}