{"as_of":"2026-08-10T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bfc36b637a2aeb8d6d862020e22abd3e2e0dfaeb0c0f1d91cd196c9de25bf0e","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:33:09.283416Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18563/citation-record","integrity":"/paper/2505.18563/integrity","json":"/paper/2505.18563/citation-record.json","paper":"/paper/2505.18563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.025605Z","title":"Lamda: Language models for dialog applications,","venue":null,"work_id":"8038c8b5-1fac-4dea-b876-39951c7e431f","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.360167Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:d4bdf8f85a89dc11d9390803a1bde04430db487c3fa2aefd08b92bf385936d0d","observation_id":"1b16e1ef-9415-4003-aa77-449a7e2e1fc3","resolution":{"observed_at":"2026-08-07T14:33:13.028880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.016146Z","title":"Software- defined network assimilation: bridging the last mile towards centralized network configuration management with nassim,","venue":null,"work_id":"e907afd5-c00a-4263-9874-4284d2b1ac67","year":2022},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.480331Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:b82556f966e1eabc3ea115174609ec4291830ae455a2a142a6bea149f8d40a3f","observation_id":"02c42822-2011-4d44-8a9d-91aa8f60608e","resolution":{"observed_at":"2026-08-07T14:33:13.019865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.006564Z","title":"Netllm: Adapting large language models for networking,","venue":null,"work_id":"8aff3a40-7d3c-4611-aabf-2407cf0272e4","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.572128Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:d47dbe6293130bbc521e9685ec76e8a7214fe2650b3a7a8ba88ea31a85497643","observation_id":"7394f8b4-4d7d-43d9-be79-6cd4c137d5b4","resolution":{"observed_at":"2026-08-07T14:33:13.009768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.995971Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":"a7f52e82-efb4-4c9b-a26a-c618485664ac","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.673961Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:96c9ecb33a49899e58240bd07fcb9ce08f32831529b8a940c91e406d1e438fbb","observation_id":"0ad9e34f-df9e-4de4-9261-21f8535d1703","resolution":{"observed_at":"2026-08-07T14:33:12.999753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.986149Z","title":"Language models are few-shot learners,","venue":null,"work_id":"66c078be-3bbe-40b1-a0ca-29617f51be04","year":2020},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.745238Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:a6338a84c9f6cc0dd2e41d8bbeb9234f60fa22ac30aec9b5765aa49138442e1c","observation_id":"f702503a-9e72-4ed9-8673-3232dafe8785","resolution":{"observed_at":"2026-08-07T14:33:12.989667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.976542Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"7f5b5b3b-a23d-4b62-8e76-44d547eb3b2f","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.835108Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:f4bef3d6f2f16f3cf6e575d5a1f2cf1ca6911bf9cad1d524abf909628a5c93ae","observation_id":"97014f19-5034-4ac3-b7e0-dba8b33bf6f1","resolution":{"observed_at":"2026-08-07T14:33:12.979925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.967548Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":"e387f5e5-a319-4252-a2f8-b7400a059adb","year":2016},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.899000Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:a232140b895b935100acbe1640f860fc30ee419ead9aac7a2af6f7339ea5b7a5","observation_id":"40c0a9ee-b5d8-4fe5-ab97-de1576beca71","resolution":{"observed_at":"2026-08-07T14:33:12.970717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.956958Z","title":"Accelerating model training in multi-cluster environments with consumer-grade gpus,","venue":null,"work_id":"a129fe17-2e9b-43e8-ba47-297652346ec1","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.000334Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:67d7b8337a88d16174147da6203bd2a61eeff1e10e3d6d401410fc97f9c0b762","observation_id":"6720b734-7f20-4baf-a23d-8a94754854b7","resolution":{"observed_at":"2026-08-07T14:33:12.960959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.948017Z","title":"Crux: Gpu-efficient communication scheduling for deep learning training,","venue":null,"work_id":"f7c334e7-caad-400f-91de-8bd9f7956d38","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.098228Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:15380714f6877ce629a646cc74eb53b8fcb9f7677ab6da852cb5ea79aa7f1ca9","observation_id":"a69a6ddd-5b04-4e0d-9519-2f9418da3606","resolution":{"observed_at":"2026-08-07T14:33:12.951209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.939139Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs,","venue":null,"work_id":"c8d4480d-33d0-4078-af1c-91e8853edb96","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.173635Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:f61ce275585dcbf3ac3b62abea2b48b2029880073206e54ab8f03a16571b015e","observation_id":"15ac1d75-6a3a-45d0-928d-5680e32563e8","resolution":{"observed_at":"2026-08-07T14:33:12.942249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01378","last_updated":"2024-10-29T11:24:30Z","snapshot_observed_at":"2026-08-09T21:04:27.365697Z","submitted_at":"2024-07-01T15:32:28Z","title":"Beyond Throughput and Compression Ratios: Towards High End-to-end Utility of Gradient Compression","version":2},"cited_work":{"arxiv_id":"2407.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01378","snapshot_observed_at":"2026-08-07T14:33:10.696622Z","title":"Beyond Throughput and Compression Ratios: Towards High End-to-end Utility of Gradient Compression","venue":"cs.LG","work_id":"c720889d-ac78-4f16-9b7b-2a7eaa686169","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.263177Z"},"links":{"cited_paper":"/paper/2407.01378","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:17d2b6d07591398caa15d07f78aabbbcc331451db447a36b6e680b396c83f795","observation_id":"4ec3f4ce-21e0-4688-a093-31c5d6ba4b4e","resolution":{"observed_at":"2026-08-07T14:33:10.803961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03158","last_updated":"2025-07-31T13:53:50Z","snapshot_observed_at":"2026-08-09T06:41:11.918621Z","submitted_at":"2024-02-05T16:27:59Z","title":"Optimal and Near-Optimal Adaptive Vector Quantization","version":2},"cited_work":{"arxiv_id":"2402.03158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03158","snapshot_observed_at":"2026-08-07T14:33:10.437367Z","title":"Optimal and Near-Optimal Adaptive Vector Quantization","venue":"cs.LG","work_id":"e820f836-9d49-4d61-b061-3bd923b74dfe","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.355547Z"},"links":{"cited_paper":"/paper/2402.03158","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:2a7f7e3ee06c17b8fa786fa68af300f2bb22d5d9b5b48dd57dbc1e9747a9bceb","observation_id":"660b1518-15a4-463c-8e75-2399b1d5d1ed","resolution":{"observed_at":"2026-08-07T14:33:10.495984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.929338Z","title":"Terngrad: Ternary gradients to reduce communication in distributed deep learning,","venue":null,"work_id":"3326cd5f-def5-4007-b7a1-fab3943bd926","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.461090Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:7e82f1883c28156b4769c1db2c0d3d0d7a193427b00b856fa9c1390549279f8f","observation_id":"7a1b3fba-1e85-441d-83f2-76e9a546105b","resolution":{"observed_at":"2026-08-07T14:33:12.932782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08545","last_updated":"2024-03-05T21:40:25Z","snapshot_observed_at":"2026-07-06T14:52:42.809602Z","submitted_at":"2023-02-16T19:48:20Z","title":"THC: Accelerating Distributed Deep Learning Using Tensor Homomorphic Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08545","snapshot_observed_at":"2026-08-07T14:33:05.623994Z","title":"Thc: Accelerating distributed deep learning using tensor homomorphic compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.623994Z"},"links":{"cited_paper":"/paper/2302.08545","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:fd0353f8c09c6e03fc907fde8eba28fe80be2cb8b36918c2f935db6c94319dc8","observation_id":"f24faac5-a4fd-4fb4-b585-e4bddcef9e40","resolution":{"observed_at":"2026-08-07T14:33:05.623994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.920307Z","title":"Sparse communication for distributed gradient descent,","venue":null,"work_id":"ade39d4d-37f1-4eda-ad7e-ad8500e3ebce","year":2017},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.719509Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:3c9a01a003fe5b6068e81ab2e234038cd9e642f23ea11108f4229d58ecc98356","observation_id":"9414227c-d76b-4e8e-b74f-cd54e3ebbf12","resolution":{"observed_at":"2026-08-07T14:33:12.923440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.911229Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":"182d5862-a1d3-418e-8eb5-127ca92b8da7","year":2018},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.824995Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:460000efbafab86394dc5211c86a32c32baaa60bec31398fbde241756d4d3249","observation_id":"a580c70b-d1f2-424a-aa98-3f10561c8d9b","resolution":{"observed_at":"2026-08-07T14:33:12.914298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13727","last_updated":"2020-02-18T14:13:56Z","snapshot_observed_at":"2026-08-03T23:32:37.116762Z","submitted_at":"2019-05-31T17:25:13Z","title":"PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13727","snapshot_observed_at":"2026-08-07T14:33:05.904277Z","title":"Powersgd: Practical low-rank gradient compression for distributed optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.904277Z"},"links":{"cited_paper":"/paper/1905.13727","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:5d88ba38a3955b0460beeaee8b0fa6fa46e94d28427bd4a1263f3c86d18e6c3c","observation_id":"e2d0e15c-5da9-4404-adb1-92cbbe2c74de","resolution":{"observed_at":"2026-08-07T14:33:05.904277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.900455Z","title":"Grace: A compressed communication framework for distributed machine learning,","venue":null,"work_id":"01322058-3e5e-4824-9b47-c778f2b60d56","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.976327Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:d318c397dbadded7bfe1f9e1080898f9c2380f2dfbf69d1059252e225c5c1157","observation_id":"f7ee06a5-28c6-4166-a4c9-d63d20e7873e","resolution":{"observed_at":"2026-08-07T14:33:12.903920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.891186Z","title":"Efficient sparse collective communication and its application to accelerate distributed deep learning,","venue":null,"work_id":"c82ced6d-d490-45db-829d-096b655d3a5d","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.059999Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:41258a810361a65f73c47a2d5f2b72218d916408ce5f12312af84be862df6cd6","observation_id":"4709eb89-bbbb-41ec-b027-f9267ef15a97","resolution":{"observed_at":"2026-08-07T14:33:12.894496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13254","last_updated":"2024-12-14T00:20:13Z","snapshot_observed_at":"2026-08-04T20:47:56.981407Z","submitted_at":"2023-09-23T04:32:48Z","title":"Empowering Distributed Training with Sparsity-driven Data Synchronization","version":2},"cited_work":{"arxiv_id":"2309.13254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13254","snapshot_observed_at":"2026-08-07T14:33:10.226932Z","title":"Empowering Distributed Training with Sparsity-driven Data Synchronization","venue":"cs.LG","work_id":"a94746f9-d1f7-4db2-a1d4-8d65cb9156d3","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.137841Z"},"links":{"cited_paper":"/paper/2309.13254","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:11af890362ad318308a2988f757942c075e74b94f84570974ef31401ecca3e6d","observation_id":"2537ae0a-8c51-4093-aae5-d706f2c0d8b8","resolution":{"observed_at":"2026-08-07T14:33:10.293013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.881555Z","title":"Embrace: Accelerating sparse communication for distributed training of deep neural networks,","venue":null,"work_id":"bc485ac4-6437-4ce5-9db5-70ec59c88882","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.209610Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:7b7d29f4e5905634acb8598bcb364cce099fbb70a62e7645809761a96c4189c6","observation_id":"46aa9f87-30d4-41ed-bffd-49ac97ae2787","resolution":{"observed_at":"2026-08-07T14:33:12.884913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.872445Z","title":"Hi-speed dnn training with espresso: Unleashing the full potential of gradient compression with near-optimal usage strategies,","venue":null,"work_id":"2b059ce5-5ca2-4143-b720-61e02461ee2b","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.276642Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:e159123179e7c790ee623d5ec688fa03c89dfa4e107c65447d4f94685bcf774f","observation_id":"06ba9546-6f63-4b94-ae5d-eb54e8c08417","resolution":{"observed_at":"2026-08-07T14:33:12.875489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.863151Z","title":"Mccs: A service-based approach to collective communication for multi- tenant cloud,","venue":null,"work_id":"e31f5e2b-9587-42f0-ab47-0643be3f104b","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.378282Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:13f27465c723dc2525f77844fb038e2707cb98bc4122c62ba104dbb5f223b9f2","observation_id":"22cd188f-e60a-4168-956b-d21feef6b59d","resolution":{"observed_at":"2026-08-07T14:33:12.866365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.702300Z","title":"Swing: Short- cutting rings for higher bandwidth allreduce,","venue":null,"work_id":"c434e3ac-a821-4df2-adb1-82ddd799713d","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.460867Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:817d3849fee762e68527213f7b13604914028eb63a79bf890ab9e4c3fee27e9e","observation_id":"ef1cb3be-3835-4b1c-bb81-caca54b4bb62","resolution":{"observed_at":"2026-08-07T14:33:12.776047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.557388Z","title":"Scaling distributed machine learning with the parameter server,","venue":null,"work_id":"73f61a02-026a-4ee7-9a49-1df486e2e20d","year":2014},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.532262Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:2f956c54dc5e008983eb3bb75f0d332cdd2905a297658be7aff22cf54d828206","observation_id":"4479651a-a866-4b78-bd8a-49317d198bbc","resolution":{"observed_at":"2026-08-07T14:33:12.636800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.307859Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation,","venue":null,"work_id":"1a72a79a-e0e1-4d9b-8d89-7b9b00255e4f","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.612420Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:c39ae7a6008515682e5895c361d942c9b40dd46c1393203c64b1a16918a5b4b3","observation_id":"f3239e28-1721-4bf8-8d1d-0c4116ded69c","resolution":{"observed_at":"2026-08-07T14:33:12.385243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.152091Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":"38975d7b-de07-4406-8548-b0dcee1b718b","year":2009},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.682424Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:f0adb61c867344e7652a0496dbbf3e7499cea701783acf112204bbbe1e77fbf9","observation_id":"ec05e3e5-aa0a-404b-a502-5423fb4fbad9","resolution":{"observed_at":"2026-08-07T14:33:12.211594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-07T14:33:06.781146Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.781146Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:63886534133d6fc4583b44116931b54d0e137fe9f5ce59d363068659c256f1d6","observation_id":"68352ec8-5c49-4c41-90db-1451e8fc49d6","resolution":{"observed_at":"2026-08-07T14:33:06.781146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-07T14:33:06.832443Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.832443Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:7aa82e4a0f30859ea08ee8df0708b2f0e36ddc8e240c66f61240355c1d93ce1c","observation_id":"29a5d79a-a9ee-418d-b885-49b8877bc7fd","resolution":{"observed_at":"2026-08-07T14:33:06.832443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.043411Z","title":"Learning both weights and connections for efficient neural networks,","venue":null,"work_id":"29a64f07-0513-4037-aa25-40271a6c0cc2","year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.927417Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:78e0a27fcc2dfed88e91913cabbb35af359c9c19cea623b0dc222d2c746ae053","observation_id":"3c16b236-6aad-4096-a90a-ff047dd730b5","resolution":{"observed_at":"2026-08-07T14:33:12.117984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.921067Z","title":"Pruning filters for efficient convnets,","venue":null,"work_id":"c42349d8-3761-46d5-9cf0-6bbd14dc4211","year":2017},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.031745Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:ddc9499f32fdfe06798c311fb65c911151de38ca4e3edf406ad2d0d506152abe","observation_id":"8c6163a6-2948-4970-a0eb-0f8a4b423fd9","resolution":{"observed_at":"2026-08-07T14:33:11.974867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.767297Z","title":"Pruning convolutional neural networks for resource efficient inference,","venue":null,"work_id":"b42a5687-5372-49bb-aed4-53fc1182b174","year":2017},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.058902Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:f3d9df0cfb6928860faa936d0085693ac14005fc14c7f8f1e4573763ab22dbc4","observation_id":"aa9ae124-1a0b-4850-8648-05823f84458c","resolution":{"observed_at":"2026-08-07T14:33:11.835003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.607453Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks,","venue":null,"work_id":"0f0dbb1d-4380-49a8-a01d-2411dd84b7b6","year":2019},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.065895Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:61200e2d45e6a43fd513f95a473038b43f47741c72693c77cc3e6ea3795e6627","observation_id":"178f5eae-2081-4793-af0b-8ce5660f1d23","resolution":{"observed_at":"2026-08-07T14:33:11.725087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.420127Z","title":"Earlybert: Efficient bert training via early-bird lottery tickets,","venue":null,"work_id":"89c38d1d-7b1d-46c1-9402-cfcc9bf4cd46","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.185904Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:52ef61da96346c3536ea732fed34b496a370673ec2aa6544abda5f2c8eeca762","observation_id":"edd56c52-c9cd-49b3-a35b-63d5a590ede8","resolution":{"observed_at":"2026-08-07T14:33:11.475502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.293185Z","title":"When to prune? a policy towards early structural pruning,","venue":null,"work_id":"0408ea68-6218-454e-85f0-670a6600b1df","year":2022},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.274785Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:7a88b78ccacd42f8da288520183963bec20f2eb515afb3bc606eae28dc058c38","observation_id":"c4d30ed4-1b4a-4db1-bdba-bfcab31b904a","resolution":{"observed_at":"2026-08-07T14:33:11.347953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00414","last_updated":"2019-07-19T14:59:45Z","snapshot_observed_at":"2026-07-06T07:49:47.294073Z","submitted_at":"2019-05-01T17:57:26Z","title":"Similarity of Neural Network Representations Revisited","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00414","snapshot_observed_at":"2026-08-07T14:33:07.453865Z","title":"Similarity of neural network representations revisited,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.453865Z"},"links":{"cited_paper":"/paper/1905.00414","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:615d3dfc189c1fd6fd3f936ea8c877bf22ffdbfb1d76be31b33283421aa7a27b","observation_id":"e3598b0d-dd44-4edc-87cf-65be90744cb3","resolution":{"observed_at":"2026-08-07T14:33:07.453865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04934","last_updated":"2024-01-27T17:07:46Z","snapshot_observed_at":"2026-08-07T08:29:22.239111Z","submitted_at":"2023-04-11T02:12:02Z","title":"Model Sparsity Can Simplify Machine Unlearning","version":13},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04934","snapshot_observed_at":"2026-08-07T14:33:07.577411Z","title":"Model sparsity can simplify machine unlearning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.577411Z"},"links":{"cited_paper":"/paper/2304.04934","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:09339da02efbaf0eccfaf0f9d95fb828cbf77167d8e407f0510fe79d7454aca2","observation_id":"e4be9c19-7374-4467-97ce-d73aa8f2c4bd","resolution":{"observed_at":"2026-08-07T14:33:07.577411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02025","last_updated":"2024-03-15T15:28:11Z","snapshot_observed_at":"2026-07-06T16:27:07.155310Z","submitted_at":"2023-10-03T13:05:36Z","title":"DeepZero: Scaling up Zeroth-Order Optimization for Deep Model Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02025","snapshot_observed_at":"2026-08-07T14:33:07.641230Z","title":"Deepzero: Scaling up zeroth-order optimization for deep model training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.641230Z"},"links":{"cited_paper":"/paper/2310.02025","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:886625eaa6fd409eda7c7ae644498fcf33ec0d1e12f94926e38711f310f3cf28","observation_id":"977b89b3-1b0d-42b5-a137-606f9053807d","resolution":{"observed_at":"2026-08-07T14:33:07.641230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14737","last_updated":"2024-03-21T13:54:36Z","snapshot_observed_at":"2026-08-09T15:52:48.657585Z","submitted_at":"2024-03-21T13:54:36Z","title":"FedMef: Towards Memory-efficient Federated Dynamic Pruning","version":1},"cited_work":{"arxiv_id":"2403.14737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14737","snapshot_observed_at":"2026-08-07T14:33:09.842586Z","title":"FedMef: Towards Memory-efficient Federated Dynamic Pruning","venue":"cs.LG","work_id":"dbc51b48-35e9-4988-bfc8-a1051894ffc7","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.827582Z"},"links":{"cited_paper":"/paper/2403.14737","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:be6a7e99d03c878197091c9917f2b10cee16cfd85618cc55080d6cd2f41499cb","observation_id":"5531f0b4-2c7b-4375-a194-6241cb0d90e3","resolution":{"observed_at":"2026-08-07T14:33:10.010083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02507","last_updated":"2022-08-04T07:37:07Z","snapshot_observed_at":"2026-08-09T19:39:12.311081Z","submitted_at":"2022-08-04T07:37:07Z","title":"ZeroFL: Efficient On-Device Training for Federated Learning with Local Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.02507","snapshot_observed_at":"2026-08-07T14:33:08.014894Z","title":"Zerofl: Efficient on-device training for federated learning with local sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.014894Z"},"links":{"cited_paper":"/paper/2208.02507","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:05443a6053128d2c50806323c183821ffa94187fcf6ad933f0c652f2ab8d987f","observation_id":"a1e18b4a-ad6d-4010-abd0-81ec12e8042d","resolution":{"observed_at":"2026-08-07T14:33:08.014894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09824","last_updated":"2021-12-18T02:26:38Z","snapshot_observed_at":"2026-07-06T12:20:09.242116Z","submitted_at":"2021-12-18T02:26:38Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","version":1},"cited_work":{"arxiv_id":"2112.09824","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09824","snapshot_observed_at":"2026-08-07T14:33:09.496629Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","venue":"cs.LG","work_id":"e9626034-ba03-4f40-9904-3b6270777c56","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.206537Z"},"links":{"cited_paper":"/paper/2112.09824","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:ecad1aec9b76422351e0f6875f811688aaea78e3baaba4d87a37fae1ca9cbfd3","observation_id":"a8b4ffed-e768-441e-bc14-042c92e7d805","resolution":{"observed_at":"2026-08-07T14:33:09.687915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01977","last_updated":"2023-07-11T13:09:37Z","snapshot_observed_at":"2026-08-10T04:39:14.531164Z","submitted_at":"2022-12-05T01:58:45Z","title":"Distributed Pruning Towards Tiny Neural Networks in Federated Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.01977","snapshot_observed_at":"2026-08-07T14:33:08.315250Z","title":"Distributed pruning towards tiny neural networks in federated learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.315250Z"},"links":{"cited_paper":"/paper/2212.01977","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:fc16b43e6ed1cb565b3bee40e4c558efd7dabf2728890b1bea9af38af0056b19","observation_id":"0f972ac8-43ec-42de-80a7-0cbee178e8ed","resolution":{"observed_at":"2026-08-07T14:33:08.315250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0575","last_updated":"2015-01-30T01:23:59Z","snapshot_observed_at":"2026-07-06T03:53:12.119259Z","submitted_at":"2014-09-01T22:29:38Z","title":"ImageNet Large Scale Visual Recognition Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0575","snapshot_observed_at":"2026-08-07T14:33:08.453842Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.453842Z"},"links":{"cited_paper":"/paper/1409.0575","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:defb8bf1b4a757e3d4fdb9d8d3fff8e57b94474635bf610f31b6d7a588e2e0cf","observation_id":"f2dfc3e8-e0e1-4ed3-a4ef-7c1095a32b0f","resolution":{"observed_at":"2026-08-07T14:33:08.453842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.211092Z","title":"Tiny imagenet visual recognition challenge,","venue":null,"work_id":"711a6be5-4fda-478a-8864-eca22403cce1","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.684087Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:31c5b85fc01a1ff27a1b4b30e2619f6b19e792221915289d11ac8f47534d6ce3","observation_id":"08e9e393-0a91-4574-8f6d-197804569981","resolution":{"observed_at":"2026-08-07T14:33:11.225143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-10T04:53:00.900945Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-07T14:33:09.091356Z","title":"Picking winning tickets before training by preserving gradient flow,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:09.091356Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:29d7eed01fe9c1498c547b31ba7b1c748aad22ec869c0392005e07a943a22f9b","observation_id":"ea803949-0526-4e7c-9a97-99374dd142f1","resolution":{"observed_at":"2026-08-07T14:33:09.091356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:10.927869Z","title":"Nvidia collective communications library (nccl),","venue":null,"work_id":"526540eb-8a50-490c-865b-1990fc573919","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:09.283416Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:5f7152702d826f7b0f980f663409182901505e1cf3dfbe176f13628f85d8fce2","observation_id":"e51246c9-3a45-43a1-b1a9-c44c796cc09d","resolution":{"observed_at":"2026-08-07T14:33:11.026796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.120614Z","title":"Available: https://api.semanticscholar.org/CorpusID: 16664790","venue":null,"work_id":"f6a42bb6-6456-42dc-9b09-b0eea75563a5","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.873107Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:d880b9f0b28b5d302e2002e3867c79003f11d03233f388c0fdfa78c6e811247a","observation_id":"3ba89639-9951-4bca-a99a-a2af97db07f3","resolution":{"observed_at":"2026-08-07T14:33:11.162717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07878","last_updated":"2017-12-29T02:51:48Z","snapshot_observed_at":"2026-08-04T02:15:05.508326Z","submitted_at":"2017-05-22T17:42:15Z","title":"TernGrad: Ternary Gradients to Reduce Communication in Distributed Deep Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07878","snapshot_observed_at":"2026-08-07T14:33:05.545231Z","title":"Available: https://arxiv.org/abs/1705.07878","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.545231Z"},"links":{"cited_paper":"/paper/1705.07878","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:44b46d196f6d755e34aa38ab470a96def98d66f387ae825df2c3f626e320ed61","observation_id":"dd5850b4-e66a-4141-8a24-ed4516cc1ca6","resolution":{"observed_at":"2026-08-07T14:33:05.545231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T14:33:04.403728Z","title":"Available: https://arxiv.org/abs/2201.08239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.403728Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:8cfc479e54a9dbeaa2eeaf968f7b5bd20609672df32603959f6bab3c464f0bfc","observation_id":"eccd5bca-28b6-453b-a1f2-f0907fcf9127","resolution":{"observed_at":"2026-08-07T14:33:04.403728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T15:40:41.649571Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":5,"verified_fuzzy":31},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2505.18563."}