{"as_of":"2026-08-09T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e820f5016f7bfa578849c1b9ab21e530d4e056e3c66b9ec3e0a8bedd4727409","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:17:35.344583Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.10236/citation-record","integrity":"/paper/2512.10236/integrity","json":"/paper/2512.10236/citation-record.json","paper":"/paper/2512.10236"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:25.471057Z","title":"Conccl: Optimizing ML concurrent computation and communication with GPU DMA engines,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:25.471057Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:95bd15b6261dded14a9b65f3a1fa6466299bcb39707659cb1d0fcabdab0b96c4","observation_id":"4b5929eb-a249-4f62-9e58-090973696279","resolution":{"observed_at":"2026-08-03T17:17:25.471057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:25.502992Z","title":"[Distributed GEMM: A novel CUTLASS-based implementation of Tensor Parallelism for NVLink-enabled systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:25.502992Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:f634e72dc153f2ddd31761c17d2f6f2bb5dd924f4a58904ac40e0e35916ee2b9","observation_id":"f07a0ad4-d66e-420c-9af1-4712e0a6223e","resolution":{"observed_at":"2026-08-03T17:17:25.502992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:25.528116Z","title":"(2023) Amd instinct™ mi300x accelerators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:25.528116Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:dd2f2298ab5149797e93ee0efb1912ef69ba36a64461e1ae5bfa2e1bdec89cdb","observation_id":"18e5e7a7-f1bd-46ac-afca-0966b0e75a2f","resolution":{"observed_at":"2026-08-03T17:17:25.528116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:25.636722Z","title":"HIP: C++ Heterogeneous-Compute Interface for Portability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:25.636722Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:3e7d74c477d5d2a3802a01fbb2d4c54bb601b7e1fdbded94d2b2bca527430ab5","observation_id":"ab604659-6c91-4c41-8850-808e7a442ee6","resolution":{"observed_at":"2026-08-03T17:17:25.636722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:25.804954Z","title":"ROCm Communication Collectives Library (RCCL),","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:25.804954Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:ea199a571edc724dc9270a349e04b377ec8c1af52a337245919e24eb856d9b5b","observation_id":"1c2d3159-5199-4556-a994-599e2fd816df","resolution":{"observed_at":"2026-08-03T17:17:25.804954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:25.884659Z","title":"ROCm: HIPStream,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:25.884659Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:d6aee3c0a7c34d72c5dee1cb52c6d37e8ebb640b002c65b0c2816e6e7d222f8c","observation_id":"6020bb3a-af2c-42c6-ba41-1e9db5ad97e7","resolution":{"observed_at":"2026-08-03T17:17:25.884659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:26.005505Z","title":"ROCm/rocBLAS: Next generation BLAS implementation for ROCm platform,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:26.005505Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:99db58293ed9d6b6cb2320f56f818e75bc2321d1d9e35f701f5c135d488fb1ed","observation_id":"63efbc59-c3e8-4f35-bbe1-b0663b9d1deb","resolution":{"observed_at":"2026-08-03T17:17:26.005505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:26.264006Z","title":"(2025) Hip graphs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:26.264006Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:c40c917c5f72aae677eff4c3613e49c8d222bf610c378fee59561a89ae4124e7","observation_id":"fba75d10-4eb1-4289-8956-92994a273211","resolution":{"observed_at":"2026-08-03T17:17:26.264006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:26.379167Z","title":"(2025) hipblaslt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:26.379167Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:33bd5a72c4c64a2b902d187139d2b17357c1bec8a851cd55afbb89cb531ddc6f","observation_id":"cad949b9-fbba-4e12-834e-8b5bfee9bb83","resolution":{"observed_at":"2026-08-03T17:17:26.379167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-07T05:35:13.505081Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-08-03T17:17:26.613570Z","title":"FLUX: fast software-based communication overlap on gpus through kernel fusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:26.613570Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:ebffeafd4eafd927e4b2951fcc35f8f96c79429ae221fb23097a3ab297ac686e","observation_id":"36560a66-9cab-4c92-b8b5-e8ead0d488de","resolution":{"observed_at":"2026-08-03T17:17:26.613570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:26.799537Z","title":"Centauri: Enabling efficient scheduling for communication- computation overlap in large model training via communication partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:26.799537Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:cf56676a69f1fbbcc7103473f71c31910632e459a0ed74e15ad2250af2d5a1a4","observation_id":"4fe50f2a-2b6e-4187-b873-a50a69736e48","resolution":{"observed_at":"2026-08-03T17:17:26.799537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-03T17:17:27.038056Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.038056Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:97d9bd9c12cc73ccc17e85bf492fe28e117c4db1ab4fa09fbbeec4556f9d4ba2","observation_id":"007169a4-fc2a-41d4-8285-83331db20969","resolution":{"observed_at":"2026-08-03T17:17:27.038056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:27.194833Z","title":"Revisiting scaling laws for language models: The role of data quality and training strategies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.194833Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:82570ee09566d8869b014d11a86d8236e1b08d1cd3df26cfd8b21e618bbba3d2","observation_id":"c0cc879a-857b-4c85-acb6-4e1133c75e4d","resolution":{"observed_at":"2026-08-03T17:17:27.194833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:27.296653Z","title":"Concerto: Automatic communication optimization and scheduling for large-scale deep learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.296653Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:6c8450cbfae5932fe3136f90e397baa044db91d6c8344afd1f749875d0188f57","observation_id":"520d00d8-4d08-4ac7-8eec-e0e1a80c8a79","resolution":{"observed_at":"2026-08-03T17:17:27.296653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:27.429870Z","title":"Scaling llama 3 training with efficient parallelism strategies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.429870Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:b77dc6aca47a3d357df7e0af714708f6bf6f09c9e5b29f3d84d0db88b99ac590","observation_id":"ecfe41e1-9461-404b-9279-34c042912945","resolution":{"observed_at":"2026-08-03T17:17:27.429870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:27.653172Z","title":"Transformations to parallel codes for communication-computation overlap,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.653172Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:67d3a8cd5b5e2a31c006a3709ef63e395741909aab64543f20106994afb2ac15","observation_id":"9811d8b7-41df-4da8-a041-b8ad608cf761","resolution":{"observed_at":"2026-08-03T17:17:27.653172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:27.846495Z","title":"Mpi-aware compiler optimizations for improving communication-computation overlap,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.846495Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:7fac6bc79fb514e956b3fa29463e54f06801f9ecfe7d86b19b8cca8fdab43f94","observation_id":"d3436e9a-4498-4e81-bcf5-0032a61cec4c","resolution":{"observed_at":"2026-08-03T17:17:27.846495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:27.946846Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:27.946846Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:eb42501a4e8d9e06aff3c9311fa4dc8dba7fed450c98b55b42742d605dd585b6","observation_id":"4323b855-f1b8-4f81-b1e4-85ffb603c56c","resolution":{"observed_at":"2026-08-03T17:17:27.946846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.126438Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.126438Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:b3045ee113eef70e1f345344f63836122ea51520d10a67f74422935283aa6d70","observation_id":"c68991d0-8eac-46a7-baed-56869f14f2e3","resolution":{"observed_at":"2026-08-03T17:17:28.126438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.354666Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.354666Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:055b540ffda21990efded172aa5af792ef7204cd781b5749bdb7e52f9a429faa","observation_id":"666f6fc9-1976-4e72-998a-8143d8fdd541","resolution":{"observed_at":"2026-08-03T17:17:28.354666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.544971Z","title":"Compiler-assisted overlapping of communication and computation in mpi applications,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.544971Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:6e94df1a1aad81dd06fd805ab724c3a8a4f9d6ac5c0e51390ccd5b88c632f422","observation_id":"70a54b9f-f67f-4119-b29c-5b9ef0433d25","resolution":{"observed_at":"2026-08-03T17:17:28.544971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.652192Z","title":"Bandwidth characterization of deepspeed on distributed large language model training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.652192Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:d20d4b7216468af098ae9e8a11e2916407359bd7fe02e3b5f7f96775d103eebb","observation_id":"6d022239-46ad-47cc-91a5-c98b24a20687","resolution":{"observed_at":"2026-08-03T17:17:28.652192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.773221Z","title":"Efficient and adaptable overlapping for computation and communication via signaling and reordering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.773221Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:e71ffd07f9ad9c759a96e9374473e8b17bcb61605d26dbca7ac5825c8de64446","observation_id":"5ee7b059-9eea-40a1-aa49-c024e50c77d5","resolution":{"observed_at":"2026-08-03T17:17:28.773221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.897418Z","title":"[Distributed w/ TorchTitan] Introducing Async Tensor Parallelism in PyTorch,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.897418Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:e750419c59c546a8804de7a56b94f221f7f0c3b62e5046e36c786d8003490595","observation_id":"2a11c22a-edaa-4416-b3d4-10e5d72b5d13","resolution":{"observed_at":"2026-08-03T17:17:28.897418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:29.056475Z","title":"Demystifying nccl: An in-depth analysis of gpu communication protocols and algorithms,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:29.056475Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:e10580d9669a7af7aca3285420880700b8c0473368ae5840da2d53d0c9bd992e","observation_id":"1ebf80fd-0592-4f99-a222-0cce9d2d799c","resolution":{"observed_at":"2026-08-03T17:17:29.056475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:29.440449Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:29.440449Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:2e2ada707579af53f397cad5f5f569344750ab3c5af67e040575f8d4c0c3568c","observation_id":"d65ced37-f761-4438-aef1-b93ed96b4257","resolution":{"observed_at":"2026-08-03T17:17:29.440449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1023/a:1007554715418","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A loop transformation algorithm for communication overlapping,","venue":"International Journal of Parallel Programming","work_id":"01a1be93-e961-4712-9b87-fcea45001eb7","year":2000},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:29.614433Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:e91dcf4f1e9b962d0a2a490db5bd4d6da2e24190143d3ba4dd2279adae1bce81","observation_id":"b7e1d71e-f259-4e1a-927d-0c2c9f3f1aeb","resolution":{"observed_at":"2026-08-03T17:18:24.297106Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:29.852284Z","title":"Breaking the computation and communication abstraction barrier in distributed machine learning workloads,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:29.852284Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:f0c5f3232f46630f8c4089cae1d70c2cc77560b62c83d744f7dbf1a9a45443dd","observation_id":"a190159f-1426-42ce-8af7-8d011f88fb58","resolution":{"observed_at":"2026-08-03T17:17:29.852284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:29.279492Z","title":"Available: https://arxiv.org/abs/2507.04786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:29.279492Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:673d196e46d43f225b9c50fcd60c69cdb969b6a3b04924ec45b52e006aacd4ea","observation_id":"b1345a36-4767-4ab8-83c5-5bd73eec4c9c","resolution":{"observed_at":"2026-08-03T17:17:29.279492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-03T17:17:30.192100Z","title":"A survey on large language models for code generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.192100Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:251e385e8700ff6bf8dd0be41eac6c8b93530b71ebc100c84c5a97c98d20fd97","observation_id":"4c219591-1d15-4ce0-8b24-73f4195677c4","resolution":{"observed_at":"2026-08-03T17:17:30.192100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:30.446070Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.446070Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:f43f5f0d6a4a9609cdde5752a9f74eea32a0a632f7f2b2c8e003d1b7a149d41a","observation_id":"35986078-4f95-4553-9cae-73c0919d8f9a","resolution":{"observed_at":"2026-08-03T17:17:30.446070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:30.609498Z","title":"Lit silicon: A case where thermal imbalance couples concurrent execution in multiple gpus,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.609498Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:937cb9e2082ed802992cd98e2f6b08550758d99d609587572f6b1a778e74b173","observation_id":"9c403f43-9525-42eb-9690-d3ca58d9cde9","resolution":{"observed_at":"2026-08-03T17:17:30.609498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-03T17:17:30.019371Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.019371Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:8e2fd06af4ac05b205a728a2e87c27c5a926ab882c116528681749f8bc237a4f","observation_id":"dd51c416-29b7-44c5-985f-da686e4fc045","resolution":{"observed_at":"2026-08-03T17:17:30.019371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:31.048465Z","title":"Pytorch 11 distributed: Experiences on accelerating data parallel training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:31.048465Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:382dfe6ee3b66e100a799f9fba5a51dcb3115dd8ba3d2ffb4526f6bc50fa60f5","observation_id":"ba0b4df0-aedb-4035-9f02-df2167f12778","resolution":{"observed_at":"2026-08-03T17:17:31.048465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-03T17:17:30.342823Z","title":"Available: https://doi.org/10.48550/arXiv.2406.00515","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.342823Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:d2e0b3d4ecb864c0eeb827a9361b5aabcc4122866790d92684467962383b0b4f","observation_id":"cbf99ac6-1ccd-456d-a7a4-8afb7573b594","resolution":{"observed_at":"2026-08-03T17:17:30.342823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-03T17:17:31.451618Z","title":"Ring attention with blockwise transformers for near-infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:31.451618Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:da193f73d32ba5893fe0f8ddd4186d832a52972920f62c415150715c02b6cc4b","observation_id":"101087c2-49b8-4ff1-b935-1f8046432efc","resolution":{"observed_at":"2026-08-03T17:17:31.451618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:31.595099Z","title":"MLPerf Inference Results v5.0,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:31.595099Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:0dd47071a101eab1c5e55ddd9d76ce5614e9f1e4bac45824409ccd255ba06c2d","observation_id":"a0455977-1bff-42a9-8448-1d2992354bd7","resolution":{"observed_at":"2026-08-03T17:17:31.595099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.09861","last_updated":"2026-05-12T23:31:13Z","snapshot_observed_at":"2026-08-07T14:47:19.904788Z","submitted_at":"2025-11-13T01:41:47Z","title":"Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.09861","snapshot_observed_at":"2026-08-03T17:17:30.775766Z","title":"Available: https://arxiv.org/abs/2511.09861","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.775766Z"},"links":{"cited_paper":"/paper/2511.09861","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:03a3e87944fbea30e24186436b7010ddb47308e422c6fb9a66c58810ab35c53b","observation_id":"1f74fec2-21cf-4e63-a31c-a1e027f276db","resolution":{"observed_at":"2026-08-03T17:17:30.775766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:30.901701Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:30.901701Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:bbe227c88ef1c8bf65a3d6cd71247050a0b9e2343fa22f7429b81151b7c98b0e","observation_id":"6730e8b1-c68d-4481-bcf3-95ac4da96a3d","resolution":{"observed_at":"2026-08-03T17:17:30.901701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-03T17:17:32.059112Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:32.059112Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:3635bf3cc1c91f8b405fbbef43fd1f86c59bf8e219851bcedf00fc792ac16520","observation_id":"35790693-991d-4143-ad02-0f3e1e4ed316","resolution":{"observed_at":"2026-08-03T17:17:32.059112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:32.345045Z","title":"T3: Transparent tracking & triggering for fine-grained overlap of compute & collectives,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:32.345045Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:11fe5428448b134e2623231b89a92032ebc6a8399c0141a32fbc18baa9afee13","observation_id":"78df471c-704c-43fc-9cff-2802f02b0c11","resolution":{"observed_at":"2026-08-03T17:17:32.345045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:32.583547Z","title":"Exact dependence analysis for increased communication overlap,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:32.583547Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:a7bebce6b7c1f95e3198c8521311bcb910eef3dc0a0a2bc3dba0546abaaeb7c4","observation_id":"2c38d75e-b571-4dd8-8b1b-85a3f11921a8","resolution":{"observed_at":"2026-08-03T17:17:32.583547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:32.835860Z","title":"Automatic gen- eration of software pipelines for heterogeneous parallel systems,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:32.835860Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:40aeb01694193fbffbe3d6aff3b1f99a2a3bcd9ab329be8480acc9725bbb6884","observation_id":"7e2b64c6-aba8-4f1e-9b47-ebbc64f35590","resolution":{"observed_at":"2026-08-03T17:17:32.835860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:31.717025Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:31.717025Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:70446e9547b7d9e88bb8ef19e90a2fd375e72a0c32e2fa36c212f6ff3dc1eb4a","observation_id":"51b9d562-2af8-4d7f-a733-486723796a23","resolution":{"observed_at":"2026-08-03T17:17:31.717025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:31.902770Z","title":"Stream-k: Work-centric parallel decomposition for dense matrix- matrix multiplication on the GPU,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:31.902770Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:ba4c22f350ba056c8098aae1b437994cf6f75d54aadd2eb7ad7b0cd2802ea461","observation_id":"29046abe-f2a1-4ce9-9571-a9d606a4e07d","resolution":{"observed_at":"2026-08-03T17:17:31.902770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:33.295676Z","title":"Enabling compute-communication overlap in distributed deep learning training platforms,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.295676Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:c92f99a742100fde3ea545d00f4a394c1abd31e734da1144aad0b8ea1ba0639b","observation_id":"4759e32d-4889-486c-9acc-2fc064a47277","resolution":{"observed_at":"2026-08-03T17:17:33.295676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:32.211232Z","title":"Tale of two cs: Computation vs. communication scaling for future transformers on future hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:32.211232Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:a57557bfc59f5b963c6ecb8c70a3aac6744cf6168bd676ff79819f75072b9d39","observation_id":"0a51ad9f-d781-4808-a33e-993e35c3bac1","resolution":{"observed_at":"2026-08-03T17:17:32.211232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:33.649111Z","title":"Slechta, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.649111Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:654988505331d75375696804e284f066250cb547e7561ef4589421103beb0758","observation_id":"024e74a0-517f-4ac1-b941-a37a295e142b","resolution":{"observed_at":"2026-08-03T17:17:33.649111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:33.749522Z","title":"Triton: an intermediate language and compiler for tiled neural network computations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.749522Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:4a5d18d41b8f7a4203c7c0719d7d3d2005f06126be2dae100e67c68ef00746ae","observation_id":"b8c98e3c-20bd-4dcf-b2e5-312232c0e7db","resolution":{"observed_at":"2026-08-03T17:17:33.749522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T17:17:33.833361Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.833361Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:8b974db55adc2ee6c1ec3a58c45091fc120925056952f87e6b96c70e880a9411","observation_id":"1225fe07-a3f5-48c3-94a6-deb695ae2959","resolution":{"observed_at":"2026-08-03T17:17:33.833361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2024","last_updated":"2014-06-08T20:52:15Z","snapshot_observed_at":"2026-07-06T03:45:47.981395Z","submitted_at":"2014-06-08T20:52:15Z","title":"Hilfer fractional advection-diffusion equations with power-law initial condition; a Numerical study using variational iteration method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2024","snapshot_observed_at":"2026-08-03T17:17:33.011909Z","title":"Optimizing distributed ML communication with fused computation-collective operations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.011909Z"},"links":{"cited_paper":"/paper/1406.2024","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:c4048080128dff96750c607406da26839753dd7acd145243626bdcb359e6669b","observation_id":"1f1f6275-507a-4394-a210-3b850abe2b1a","resolution":{"observed_at":"2026-08-03T17:17:33.011909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:33.183239Z","title":"Deepspeed-moe: Advancing mixture-of- experts inference and training to power next-generation AI scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.183239Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:1869a9d6b79f6576cb3710ff2da0cca96a7f6e40ab73056c16a0bb19f796ee5f","observation_id":"fe6e6e1c-1e64-4d4a-96e1-725d3449dad6","resolution":{"observed_at":"2026-08-03T17:17:33.183239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15241","last_updated":"2024-09-23T17:38:52Z","snapshot_observed_at":"2026-08-05T00:38:21.375351Z","submitted_at":"2024-09-23T17:38:52Z","title":"Domino: Eliminating Communication in LLM Training via Generic Tensor Slicing and Overlapping","version":1},"cited_work":{"arxiv_id":"2409.15241","doi":"10.48550/arxiv.2409.15241","metadata_source":"pith","pith_arxiv_id":"2409.15241","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Domino: Eliminating Communication in LLM Training via Generic Tensor Slicing and Overlapping","venue":"cs.DC","work_id":"398056de-105b-4c5c-9a1b-c140c6199eb3","year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.091313Z"},"links":{"cited_paper":"/paper/2409.15241","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:11e02bcb2409d476e460825ee75e0eb35a73753599784f70f1698f2df5275168","observation_id":"85adbf3d-dedf-4211-80e7-af2315733160","resolution":{"observed_at":"2026-08-03T17:18:24.045766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:33.472027Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture-of-experts training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.472027Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:12d24c8f83e1f023a16813e7a90ae437ead9fbc14b9330e96499877881fe7ca3","observation_id":"ca9c0139-2eda-49ab-8e73-ef219fd1186f","resolution":{"observed_at":"2026-08-03T17:17:33.472027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:34.367896Z","title":"Pytorch symmetricmemory: Harnessing nvlink programmability with ease,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.367896Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:98b916b35b63aad221028291c2aa4fb5e5e1a2d7cde6c09747642c0edd000e7f","observation_id":"7f2c07d2-85d7-46f3-971c-d3445892bc89","resolution":{"observed_at":"2026-08-03T17:17:34.367896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:34.437355Z","title":"Petuum: A new platform for distributed machine learning on big data,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.437355Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:f5e78816651b4c9d15677a48c54bcb90fbcbe0c01b28d4c9993e5089f7266b78","observation_id":"69d62d58-031f-4986-8647-014bfaa6c838","resolution":{"observed_at":"2026-08-03T17:17:34.437355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-02T01:51:18.711668Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-08-03T17:17:34.555509Z","title":"Context parallelism for scalable million-token inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.555509Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:70156d89dddbd99b9ee442050387770ebdc9e5b7b15bdc9b7cf1611562ecf9a8","observation_id":"855e07e4-b108-4c24-86cd-a60d72f0414a","resolution":{"observed_at":"2026-08-03T17:17:34.555509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T17:17:33.914217Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.914217Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:412396b86a808c96d720c4a49b24a6463c2ce06320bec6e52e00c90bc004e806","observation_id":"063917ac-cb0f-459a-b90d-9a7dd90d4a57","resolution":{"observed_at":"2026-08-03T17:17:33.914217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:33.981248Z","title":"Expectation vs. experience: Evaluating the usability of code generation tools powered by large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:33.981248Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:ec888d4b13b821e428ef0d02e0b84388c9f002736553f6a372d66804b9273842","observation_id":"94fe4ef9-6f68-4be2-9276-33b6f676953e","resolution":{"observed_at":"2026-08-03T17:17:33.981248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19442","last_updated":"2025-06-05T05:48:26Z","snapshot_observed_at":"2026-08-07T15:58:44.558772Z","submitted_at":"2025-04-28T03:09:22Z","title":"Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19442","snapshot_observed_at":"2026-08-03T17:17:35.012041Z","title":"Triton-distributed: Programming overlapping kernels on distributed ai systems with the triton compiler,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:35.012041Z"},"links":{"cited_paper":"/paper/2504.19442","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:853546b331f0445e3d77712fe62a7286531dcd8f933849e2cfafd9664730adb4","observation_id":"5f4c9bf8-c59f-4d2c-819f-3ee88f462063","resolution":{"observed_at":"2026-08-03T17:17:35.012041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:34.315521Z","title":"Overlap communication with dependent computation via decomposition in large deep learning models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.315521Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:41cd4c198f538d8728f28a55c652e71e8f1c3b91a1b050c24eec50746fffd158","observation_id":"4144954e-45a9-4361-95a8-7eea2a9c58ac","resolution":{"observed_at":"2026-08-03T17:17:34.315521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19811","last_updated":"2025-03-04T09:54:37Z","snapshot_observed_at":"2026-08-07T17:43:51.481712Z","submitted_at":"2025-02-27T06:36:45Z","title":"Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19811","snapshot_observed_at":"2026-08-03T17:17:34.668108Z","title":"Comet: Fine-grained computation-communication overlapping for mixture- of-experts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.668108Z"},"links":{"cited_paper":"/paper/2502.19811","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:99a86962a4ac3129cb6ca3c2affcb693780409f6b7ef7f805998fd998b808d84","observation_id":"b7dfa958-f4b1-49c2-bcd7-168b8b0d4c76","resolution":{"observed_at":"2026-08-03T17:17:34.668108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:34.804923Z","title":"Pytorch FSDP: experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:34.804923Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:68883be2efdf63cbb1e148d7dd30e741996c161abe7a263484dc4ec4e7fb3a55","observation_id":"eba6e6b8-f352-423f-9a99-c917c6ea7b77","resolution":{"observed_at":"2026-08-03T17:17:34.804923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:35.176285Z","title":"Tilelink: Generating efficient compute-communication overlapping kernels using tile-centric primitives,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:35.176285Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:4a2657ba510274128cc78f76d70644b41b5882e668bb773c7db2ce6a972ab5b8","observation_id":"d6addf3b-2ebb-4f6b-ac3f-912ead8416bd","resolution":{"observed_at":"2026-08-03T17:17:35.176285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:35.344583Z","title":"Available: https://openreview.net/forum?id=ccjvBkTRRe 13","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:35.344583Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:a09d3e93bf350e71419ff25e7297099f46d50093e7f7dddc3e2d84fb8b14910a","observation_id":"e6fe2106-d242-46e5-a249-fe60a74d8e6c","resolution":{"observed_at":"2026-08-03T17:17:35.344583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:17:28.040628Z","title":"Available: http://papers.nips.cc/paper files/paper/2022/ hash/67d57c32e20fd0a7a302cb81d36e40d5-Abstract-Conference.html","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.040628Z"},"links":{"citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:65c2d0e6c16d10e1f512d6ac1209e5ff0e0c92078e7b91ed79c8051eae02fe48","observation_id":"6cbc2a96-370e-4b9c-a697-2893791ccdb7","resolution":{"observed_at":"2026-08-03T17:17:28.040628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-03T17:17:31.325255Z","title":"Available: https://doi.org/10.48550/arXiv.2310.01889","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:31.325255Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:a59a36300e5cdc23166b98aaf600206b5fc7a1b073a853ed2ef80ab57c9ac14e","observation_id":"1b136b9c-064f-4acf-9c87-707cddfa654d","resolution":{"observed_at":"2026-08-03T17:17:31.325255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T17:17:28.465120Z","title":"Available: https://arxiv.org/abs/2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.465120Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:8d0d9e6fab8e4c0dd62125427b47928811ca39793458324adc2a66439b84fc71","observation_id":"9aa5a523-c969-4931-9369-4adea9d14bec","resolution":{"observed_at":"2026-08-03T17:17:28.465120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T17:17:28.237971Z","title":"Available: https://arxiv.org/abs/2412.19437","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:28.237971Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2512.10236"},"observation_digest":"sha256:df55e904b19a819b1c4050545fe98870d06a8cd91bea81c3335217e16f313853","observation_id":"f92680db-59e5-4637-81ea-749be78a85ed","resolution":{"observed_at":"2026-08-03T17:17:28.237971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.10236","last_updated":"2026-06-03T13:48:53Z","latest_version":3,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T05:10:27.790703Z","submitted_at":"2025-12-11T02:43:27Z","title":"Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2512.10236."}