{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:EPC2SP3D6KTP23EHZYFVH6D3GF","short_pith_number":"pith:EPC2SP3D","schema_version":"1.0","canonical_sha256":"23c5a93f63f2a6fd6c87ce0b53f87b317ffb019bbdea17f4cdf1b5ba139d5d83","source":{"kind":"arxiv","id":"2503.20313","version":3},"attestation_state":"computed","paper":{"title":"TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.DC","authors_text":"Dongyang Wang, Haibin Lin, Jianxi Ye, Jin Fang, Li-wen Chang, Ningxin Zheng, Qi Hou, Size Zheng, Wenlei Bao, Xin Liu, Xuegui Zheng, Ziheng Jiang","submitted_at":"2025-03-26T08:25:12Z","abstract_excerpt":"Large deep learning models have achieved state-of-the-art performance in a wide range of tasks. These models often necessitate distributed systems for efficient training and inference. The fundamental building blocks for distributed model execution are intra-layer parallel operators. The most effective approach to enhancing the performance of intra-layer parallel operators involves overlapping computation with communication. The overlapping can be achieved through either operator decomposition or kernel fusion. While decomposing operators is straightforward to implement, it often results in su"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.20313","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.DC","submitted_at":"2025-03-26T08:25:12Z","cross_cats_sorted":[],"title_canon_sha256":"f725966ba3e1a4fc30456db4e9ae6ccaeaf2d2ebdd6822c1321e603fd2fadcd4","abstract_canon_sha256":"5a99b4c2356c9bf9d7de0cea65e0bea494dcc0c3cf619db27a4d0ad983b6cde3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:43:46.404898Z","signature_b64":"h7maBKG9Sw544zu2MQ6eHn7E+lFHhsOC0JYxeHskJu5J3HoyJp6S2irIHaFWZthyszDC6ZMzroRZ6Fqf7qjKBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"23c5a93f63f2a6fd6c87ce0b53f87b317ffb019bbdea17f4cdf1b5ba139d5d83","last_reissued_at":"2026-07-05T10:43:46.404405Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:43:46.404405Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.DC","authors_text":"Dongyang Wang, Haibin Lin, Jianxi Ye, Jin Fang, Li-wen Chang, Ningxin Zheng, Qi Hou, Size Zheng, Wenlei Bao, Xin Liu, Xuegui Zheng, Ziheng Jiang","submitted_at":"2025-03-26T08:25:12Z","abstract_excerpt":"Large deep learning models have achieved state-of-the-art performance in a wide range of tasks. These models often necessitate distributed systems for efficient training and inference. The fundamental building blocks for distributed model execution are intra-layer parallel operators. The most effective approach to enhancing the performance of intra-layer parallel operators involves overlapping computation with communication. The overlapping can be achieved through either operator decomposition or kernel fusion. While decomposing operators is straightforward to implement, it often results in su"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.20313","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.20313/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.20313","created_at":"2026-07-05T10:43:46.404471+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.20313v3","created_at":"2026-07-05T10:43:46.404471+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.20313","created_at":"2026-07-05T10:43:46.404471+00:00"},{"alias_kind":"pith_short_12","alias_value":"EPC2SP3D6KTP","created_at":"2026-07-05T10:43:46.404471+00:00"},{"alias_kind":"pith_short_16","alias_value":"EPC2SP3D6KTP23EH","created_at":"2026-07-05T10:43:46.404471+00:00"},{"alias_kind":"pith_short_8","alias_value":"EPC2SP3D","created_at":"2026-07-05T10:43:46.404471+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09200","citing_title":"Resource-aware Computation-Communication Overlap for multi-GPU ML Workloads","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19652","citing_title":"Characterizing Real-World Bugs in Tile Programs for Automated Bug Detection","ref_index":95,"is_internal_anchor":false},{"citing_arxiv_id":"2601.20595","citing_title":"Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11581","citing_title":"Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24013","citing_title":"CommFuse: Hiding Tail Latency via Communication Decomposition and Fusion for Distributed LLM Training","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19241","citing_title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02953","citing_title":"DITRON: Distributed Multi-level Tiling Compiler for Parallel Tensor Programs","ref_index":34,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF","json":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF.json","graph_json":"https://pith.science/api/pith-number/EPC2SP3D6KTP23EHZYFVH6D3GF/graph.json","events_json":"https://pith.science/api/pith-number/EPC2SP3D6KTP23EHZYFVH6D3GF/events.json","paper":"https://pith.science/paper/EPC2SP3D"},"agent_actions":{"view_html":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF","download_json":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF.json","view_paper":"https://pith.science/paper/EPC2SP3D","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.20313&json=true","fetch_graph":"https://pith.science/api/pith-number/EPC2SP3D6KTP23EHZYFVH6D3GF/graph.json","fetch_events":"https://pith.science/api/pith-number/EPC2SP3D6KTP23EHZYFVH6D3GF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF/action/storage_attestation","attest_author":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF/action/author_attestation","sign_citation":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF/action/citation_signature","submit_replication":"https://pith.science/pith/EPC2SP3D6KTP23EHZYFVH6D3GF/action/replication_record"}},"created_at":"2026-07-05T10:43:46.404471+00:00","updated_at":"2026-07-05T10:43:46.404471+00:00"}