{"as_of":"2026-08-18T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8085daa328ae75c9c2ced3cd69043897304b3664810f18bba32514d0325dad54","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:46:02.126145Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T02:13:56.272752Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-09T11:46:02.126145Z","title":"Lita: Accelerating distributed training of sparsely activated models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02581","last_updated":"2025-02-04T18:56:00Z","snapshot_observed_at":"2026-08-18T01:54:28.812878Z","submitted_at":"2025-02-04T18:56:00Z","title":"Hecate: Unlocking Efficient Sparse Model Training via Fully Sharded Sparse Data Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:46:02.126145Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2502.02581"},"observation_digest":"sha256:75c11c1b9fc1214473138b3baf784f2c6f3db7ea0cf0c21991c3499af5bf239c","observation_id":"15cb7034-8632-49a7-a5aa-702d4b59136f","resolution":{"observed_at":"2026-08-09T11:46:02.126145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":"2210.17223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating distributed moe training and inference with lina","venue":null,"work_id":"659beb77-755d-4b3c-a6cc-026d49f4f040","year":2024},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-15T08:23:16.423280Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T02:11:11.003259Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:3b58b94bbbb7afed51e29a7d716d0906853dde6abc668901a1dc68e5ba542745","observation_id":"e4379065-3428-4c30-b2d0-51dd727e2d74","resolution":{"observed_at":"2026-05-21T02:13:56.276567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-02T13:33:43.332523Z","title":"Accelerating distributed moe training and inference with lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-15T08:23:16.423280Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T13:33:43.332523Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:b63cca7a53a962a65dd8396a7ac01445dd52087c41085b35e2b61e872aa8f60d","observation_id":"03aac04b-6f71-4126-abb2-c62e37533f11","resolution":{"observed_at":"2026-08-02T13:33:43.332523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-07-11T08:35:22.347459Z","title":"Accelerating distributed moe training and inference with lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05116","last_updated":"2026-07-06T14:06:25Z","snapshot_observed_at":"2026-08-14T02:20:04.364719Z","submitted_at":"2026-07-06T14:06:25Z","title":"Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T08:35:22.347459Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.05116"},"observation_digest":"sha256:b42e7848e06fc8819f837d67eaec48431c71d7eaa6e562120560a89baf6d5f1d","observation_id":"ec240a9f-f052-489b-8326-02fd2c750cf7","resolution":{"observed_at":"2026-07-11T08:35:22.347459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-01T19:10:31.791494Z","title":"Accelerating Distributed MoE Training and Inference with Lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17074","last_updated":"2026-08-02T01:52:26Z","snapshot_observed_at":"2026-08-15T21:02:56.759001Z","submitted_at":"2026-07-19T04:45:01Z","title":"ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:10:31.791494Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17074"},"observation_digest":"sha256:1da4474e7cb10bc5c86fc395542bca0ee096621d058d3cf72480ae2526b9aaeb","observation_id":"9a146c72-edcd-43d5-8420-1dc1c82bd154","resolution":{"observed_at":"2026-08-01T19:10:31.791494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-04T04:18:21.111262Z","title":"Accelerating Distributed MoE Training and Inference with Lina,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17074","last_updated":"2026-08-02T01:52:26Z","snapshot_observed_at":"2026-08-15T21:02:56.759001Z","submitted_at":"2026-07-19T04:45:01Z","title":"ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:18:21.111262Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17074"},"observation_digest":"sha256:e174012a5d1ccad531d522a9894258b5065e83b9a7e6ce209d2307f20865feb2","observation_id":"2a710d4d-b218-4bf5-b68f-68f05679743b","resolution":{"observed_at":"2026-08-04T04:18:21.111262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17223","snapshot_observed_at":"2026-08-01T17:32:37.332884Z","title":"Liu, H., Zaharia, M., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17644","last_updated":"2026-07-20T07:57:34Z","snapshot_observed_at":"2026-08-17T12:59:56.886335Z","submitted_at":"2026-07-20T07:57:34Z","title":"A Training-Memory Regression in MLA Sequence Parallelism: Why Megatron-Core Forbids Absorption, and LAGA -- a Communication-Efficient Fix","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:37.332884Z"},"links":{"cited_paper":"/paper/2210.17223","citing_paper":"/paper/2607.17644"},"observation_digest":"sha256:3ef196b06de72e046636e26fb99a1659a3b19214711ee658f9738cff16300915","observation_id":"6dc5e0e5-a6ad-4b3e-9656-cdfaab448c1c","resolution":{"observed_at":"2026-08-01T17:32:37.332884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2210.17223/citation-record","integrity":"/paper/2210.17223/integrity","json":"/paper/2210.17223/citation-record.json","paper":"/paper/2210.17223"},"outbound":[],"paper":{"arxiv_id":"2210.17223","last_updated":"2024-04-28T21:28:12Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T16:19:49.489519Z","submitted_at":"2022-10-31T11:07:23Z","title":"Accelerating Distributed MoE Training and Inference with Lina"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2210.17223."}