Pith. sign in

Paper Citation Record · LEDGER

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences

As of 15 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2509.11076.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.11076 v2

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T17:12:42.195329Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

62 of 62 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved62
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 797489cb-11f9-413d-98b5-cfc49ddc171f · outbound

This paper cites Murray, Benoit Steiner, Paul Tucker, Vijay Va- sudevan, Pete Warden, Martin Wicke, Yuan Yu, and Xiaoqiang Zheng.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Murray, Benoit Steiner, Paul Tucker, Vijay Va- sudevan, Pete Warden, Martin Wicke, Yuan Yu, and Xiaoqiang Zheng

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.104152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.104152Z digest=sha256:f7e7c5736c3ad2bc2430e797d51924e17c14d335b16edabf89752e24fb67298c

Observation 9f6eb688-5040-446e-94c0-2d7e4ac829ce · outbound

This paper cites Tensorflow eager: A multi-stage, python-embedded dsl for machine learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Tensorflow eager: A multi-stage, python-embedded dsl for machine learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.150813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.150813Z digest=sha256:b84928aff58a3378e0b09eaf212616aa50e2ba17ca114c0beae088455f947a52

Observation 7a26902c-15f2-4f2b-9a93-0107a2327dde · outbound

This paper cites Accessed: 2024-12.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2024-12

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.195175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.195175Z digest=sha256:084d4277d6115d6d0a8aa35233ffdbd0af2136a0cc9c6a84ab74550a155b7db5

Observation bc988602-2645-4db1-9e0f-18c3d9c30f3e · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.246379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.246379Z digest=sha256:fa9175737908e580d6a37b27dcf6c5d5ccdd14dea301c3a412e9e2d251f08786

Observation 00ec6fc1-a5c3-4e06-ab35-60000b2a2eae · outbound

This paper cites Accessed: 2025-06.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-06

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.297781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.297781Z digest=sha256:40abd942d0c7765c40598c89014ed2ef93f60e2d7818c3733e8d5fcb5ab80c0f

Observation 36fd0431-fc20-45f3-8832-33b7e06c7949 · outbound

This paper cites Accessed: 2025-06.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-06

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.321654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.321654Z digest=sha256:16469a56e719cc1ebad89801dc6bb560e68ae1fec8390259d5da022722ca1d1b

Observation dc0438bf-8698-4d22-8476-b9707d6b137d · outbound

This paper cites Accessed: 2025-08.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-08

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.433480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.433480Z digest=sha256:7c121e56055935b0b66972e663a0c5465af3c68d5c12cbf9983da6d229ef10e0

Observation 92711af2-aa84-4f57-9e5b-f9c68b8f4ffc · outbound

This paper cites B, Anshuj Garg, and Purushottam Kulkarni.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences B, Anshuj Garg, and Purushottam Kulkarni

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.541213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.541213Z digest=sha256:99249b99d4476c24b865fc3bad30f82425a8a33a6cfc69771a3cbb209a41481b

Observation ac6b6635-7635-43d9-a051-917d6e76d559 · outbound

This paper cites Qwen2.5-vl technical report, 2025.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Qwen2.5-vl technical report, 2025

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.614201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.614201Z digest=sha256:44ca1ef660cdf8cca68f8ead820c9994b211d1a1d07f03ac0577ab5bf1c3e05c

Observation 31ce71fd-f98c-4098-b640-211ffe57b7e9 · outbound

This paper cites CSWAP: A self-tuning compression framework for accelerating tensor swapping in gpus.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences CSWAP: A self-tuning compression framework for accelerating tensor swapping in gpus

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.686642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.686642Z digest=sha256:2b2b31329630b3a1ffa3d39f380c7e5f40cdc9ca15eaaf724b3d6183a01016dc

Observation b97bfda7-41b9-4de2-aa49-ad4d51ebbf61 · outbound

This paper cites MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.749621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.749621Z digest=sha256:bdfa5f5c59018ce819c8e588117aec91ac245fd84d10c8b46b91ca00845587b6

Observation ccc4a09a-8b73-4d0e-a888-bec7640f8965 · outbound

This paper cites Training Deep Nets with Sublinear Memory Cost.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Training Deep Nets with Sublinear Memory Cost

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.807926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.807926Z digest=sha256:7e2bea7a29543def5837d64fe8507303ea335e832950477afb9b2c4910a7826e

Observation c5bf22d7-432e-45f2-8786-874d6d5015f2 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.873309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.873309Z digest=sha256:2fe5d4182805bb67a40845a0158f471b9130fdb8574838f0274a89ab22b6cbda

Observation 991759fb-2d42-4678-8ba3-50592d5dfc2d · outbound

This paper cites Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.917428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.917428Z digest=sha256:f4403c91083c5d3afad58c4bbc27095ddaa668e4563267b49fc1f2f7525d79ec

Observation 2dc67573-48e4-4a10-8800-166503e54001 · outbound

This paper cites Parallel training of pre-trained models via chunk-based dynamic memory management.IEEE Transactions on Parallel and Distributed Systems, 34(1):304–315, 2023.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Parallel training of pre-trained models via chunk-based dynamic memory management.IEEE Transactions on Parallel and Distributed Systems, 34(1):304–315, 2023

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.954996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.954996Z digest=sha256:a782165fed209c67a807e441348fa4798358b109be46a1e9b32f80454e0f4a08

Observation d488a174-db82-432b-a6e4-cbf9d82e8be2 · outbound

This paper cites Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:41.998889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:41.998889Z digest=sha256:047f2c324048dc9390ad220aee88baa9781d51a15fe35d7cb279225d51fdfbe8

Observation 577d206e-533d-4e19-8552-98d9b477e10d · outbound

This paper cites En- abling parallelism hot switching for efficient training of large language models.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences En- abling parallelism hot switching for efficient training of large language models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.073201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.073201Z digest=sha256:fca9283dc8ebbe1809379e4fa162a858ecd79e81188479015d818b339fc3ddbc

Observation 7e734dde-fc62-49af-ac54-bb191f94b410 · outbound

This paper cites The Llama 3 Herd of Models.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences The Llama 3 Herd of Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.079558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.079558Z digest=sha256:ac9a6ab8da17ce961bd9109a1267e9914f75af9fb830f03186379ed878c93ac2

Observation 1664a8c0-4114-42f1-b40d-291df46e3d21 · outbound

This paper cites Gmlake: Efficient and transparent gpu memory defragmentation for large-scale dnn training with virtual memory stitching.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Gmlake: Efficient and transparent gpu memory defragmentation for large-scale dnn training with virtual memory stitching

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.083044Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.083044Z digest=sha256:0bda6ec62e9bdc9cb476a9a1b2dccbb3c73ab8c464ad3f2597e557a7d83aaf86

Observation b24d8825-5e2f-40c8-ae01-4e0cb9ffa612 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.086001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.086001Z digest=sha256:1f75ed891ee36b38dc0616d22283da71b809f7f2f24111b1e00b8f189e239e1e

Observation 7f4bbcf7-afd8-4938-b592-9972c2fae70b · outbound

This paper cites Transcending runtime-memory trade- offs in checkpointing by being fusion aware.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Transcending runtime-memory trade- offs in checkpointing by being fusion aware

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.088794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.088794Z digest=sha256:b1e808c51a9f50f6346ad9652762f7d9b9987d01a857e803387e27b0f0489772

Observation e70ee0bb-0f6a-43c6-9bc1-d01d03381512 · outbound

This paper cites Gpu memory usage optimization for backward propagation in deep network training.Journal of Parallel and Distributed Computing, 199:105053, 2025.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Gpu memory usage optimization for backward propagation in deep network training.Journal of Parallel and Distributed Computing, 199:105053, 2025

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.091653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.091653Z digest=sha256:3dd03434b40e2ebf34d6ef58e3d70054c30695f390d029c4fe371bf8ab8d9be9

Observation ec6e2bc7-2f9e-4af7-acdd-b6a30267b4ad · outbound

This paper cites Meg- taichi: dynamic tensor-based memory management optimization for DNN training.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Meg- taichi: dynamic tensor-based memory management optimization for DNN training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.094362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.094362Z digest=sha256:a1accc775bad390a40e1171601f9c2d17d4371e8660121d1a8eb1caf77721ca6

Observation 17c1bc48-47e6-410a-a885-9293eda36044 · outbound

This paper cites Swapadvisor: Pushing deep learning beyond the gpu memory limit via smart swapping.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Swapadvisor: Pushing deep learning beyond the gpu memory limit via smart swapping

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.097089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.097089Z digest=sha256:c52018f16a709f1e86f77853a1280a9307a53a0d42876c270e8179844ba6157d

Observation 14854789-2eaa-4efe-a6d4-a27db1a2deb8 · outbound

This paper cites Gpipe: Efficient training of giant neural networks using pipeline parallelism.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Gpipe: Efficient training of giant neural networks using pipeline parallelism

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.099977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.099977Z digest=sha256:6d88e9ece5a532495ae83f95435a218cb68545dc1f18322e1cb7f72ddcab63d8

Observation 66d0deac-cbf2-48f4-a6f0-546be34848af · outbound

This paper cites Oobleck: Resilient distributed training of large models using pipeline templates.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Oobleck: Resilient distributed training of large models using pipeline templates

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.102682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.102682Z digest=sha256:57b9325d1802e05b809e90027b712d56bf2ef1a2224a98d7e10deb9a0629fdcb

Observation 8ff79736-8a72-40af-ae55-8c2e55ce3678 · outbound

This paper cites Caffe: Convolutional architecture for fast feature embedding.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Caffe: Convolutional architecture for fast feature embedding

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.105477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.105477Z digest=sha256:0c82d3f79d4edc02e7b32c6083e9e80cf0f819e3529b36ec6ec21fd0d9017abd

Observation df975625-0761-4e0f-8c74-8680373070e1 · outbound

This paper cites MegaScale: Scaling large language model training to more than 10,000 GPUs.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences MegaScale: Scaling large language model training to more than 10,000 GPUs

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.108218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.108218Z digest=sha256:089ec9ae6f667ceeea869bbc3eeb535478ce2603077371c69b5f8653829e5f80

Observation 652e6a8d-12a5-4cb6-883d-3c3082d39e6f · outbound

This paper cites Scaling Laws for Neural Language Models.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Scaling Laws for Neural Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.111023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.111023Z digest=sha256:9707178ee3d94e434f9e4a1604c49bf805e446a0a4ad9d9785468c08511ccf0f

Observation 65947a89-090d-4701-9c62-18e187245652 · outbound

This paper cites On model parallelization and scheduling strategies for distributed machine learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences On model parallelization and scheduling strategies for distributed machine learning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.114382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.114382Z digest=sha256:614f91816dc26fc3f3e13b84bc9630faf741d77d6a13e6b0e6b2330d3559718e

Observation 5fca8bb7-8ace-43bf-875b-b563b2d02924 · outbound

This paper cites Cognitive Intelligence and Robotics.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Cognitive Intelligence and Robotics

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.117231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.117231Z digest=sha256:665a986f87fd9bb2c817b425dae5123643e83332351fced531647b4d0581aebf

Observation 4d421a1d-4d1e-42bd-8ef1-5a95c2d6bdf6 · outbound

This paper cites Pytorch distributed: Experiences on accelerating data parallel training.Proc.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Pytorch distributed: Experiences on accelerating data parallel training.Proc

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.120255Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.120255Z digest=sha256:e2d255ed0090451b86b7e76cf694d4663c4d08af152669086235796a002427bc

Observation c0c567be-f043-4bf9-887a-a4268ca5874a · outbound

This paper cites Parameter-efficient sparsity for large language models fine-tuning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Parameter-efficient sparsity for large language models fine-tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.122767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.122767Z digest=sha256:73608ac17ea5b581e185549d05a211114c131073e22507827199cf25fa7522f4

Observation 3f0adc43-116f-483a-9fe9-aae4ad391a05 · outbound

This paper cites Model compression for deep neural networks: A survey.Computers, 12(3), 2023.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Model compression for deep neural networks: A survey.Computers, 12(3), 2023

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.125207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.125207Z digest=sha256:4ff000eb43633dc00e89115f77f3e4109e737c4cbbaba30219c73b6beac4bbf0

Observation 86ea1121-37cf-41cc-ad4e-653d37d0273c · outbound

This paper cites Ascend: a scalable and unified architecture for ubiquitous deep neural network computing : Industry track paper.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Ascend: a scalable and unified architecture for ubiquitous deep neural network computing : Industry track paper

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.128005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.128005Z digest=sha256:00d66edbc7a653853d6cfb70bbb0652586d88675107ec1533d33a5c8791935a4

Observation 803c171f-6c55-4eb2-9368-4dd7c474f4cf · outbound

This paper cites Diamos, Erich Elsen, David García, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, and Hao Wu.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Diamos, Erich Elsen, David García, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, and Hao Wu

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.130682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.130682Z digest=sha256:9c3e1c925179e33a2873874b68efe00bca120935569de3dcdc8cf5ad56c4383d

Observation 0af72ea8-2d94-41af-8d53-0b3ce91bd13a · outbound

This paper cites Devanur, Gregory R.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Devanur, Gregory R

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.133182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.133182Z digest=sha256:1d9dd77decc428cd85bd2ddde02d2f9b80a804e9d67cd89cb710c6bcd38b3204

Observation 530e2014-7b46-441a-a75d-097e2356a29b · outbound

This paper cites Accessed: 2025-06.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-06

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.135758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.135758Z digest=sha256:4532ee1a480f39438b1edf61dafac7c8acce9a96e9d755000a18f8c90ec2072c

Observation 3d355a5f-310c-4c2c-a5c6-020146ad02d6 · outbound

This paper cites Accessed: 2025-08.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2025-08

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.138653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.138653Z digest=sha256:897495f2b0917d68524bf34188ef769de3e5854843079e3cfe087791b86be22b

Observation 5af6af36-3c22-4e58-8ea6-47c062f99fa0 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.141103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.141103Z digest=sha256:0a6a29e9f3ae7adc31c04f268ade94e580f41be625fb42ce3bd1ff31c162d220

Observation 7c057b31-3913-4ae6-a3bb-de4910fa96fc · outbound

This paper cites Pytorch: An imperative style, high-performance deep learning library.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Pytorch: An imperative style, high-performance deep learning library

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.143962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.143962Z digest=sha256:1b303f8a6b7bd562a8ef59f7535bba11e0175e4110f8ecad270b17cadd712829

Observation b97db3e3-59a7-4e66-9ae7-b05b95b51096 · outbound

This paper cites Capuchin: Tensor-based gpu memory management for deep learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Capuchin: Tensor-based gpu memory management for deep learning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.146558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.146558Z digest=sha256:d2d8551b7e20214dad3bf93b2c4cccffdb38cf1a028830166215a824e0fc8cb3

Observation 4cdb95ca-0b29-46ad-b612-db34d0449ba7 · outbound

This paper cites Accessed: 2024-12.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2024-12

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.149293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.149293Z digest=sha256:ca20c160db399221602685762d046c8054c660e9d2aa8975aee17402fce9c3bc

Observation f0127d64-5468-4a1f-aab3-8549765671f7 · outbound

This paper cites Accessed: 2024-12.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accessed: 2024-12

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.151779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.151779Z digest=sha256:2e06458e2c34f9b96ddb04223998b19aad18d101288a0ef0615b23ec319408c5

Observation 7d504001-4fe5-46bf-90d8-71309c1a96d6 · outbound

This paper cites Zero: Memory optimizations toward training trillion parameter mod- els.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Zero: Memory optimizations toward training trillion parameter mod- els

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.154546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.154546Z digest=sha256:47d3df7238f25cb610a9095a63073fe5b02b692c94dace913a1cf04a62d4f8e6

Observation 24671d30-c663-4185-902b-cf4e76e265dc · outbound

This paper cites Zero-infinity: breaking the gpu memory wall for extreme scale deep learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Zero-infinity: breaking the gpu memory wall for extreme scale deep learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.157087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.157087Z digest=sha256:ab3c917df703df5303964e765d211ac651229327e58b638825544357967237f8

Observation 53cef652-1a4c-4b02-9fa2-3421141fba23 · outbound

This paper cites Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.159700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.159700Z digest=sha256:4425ce744918900f3103e422521aec82bff34b67291c100eba4b56d514b3589e

Observation 419cae02-0a1a-4773-94b8-b87654d7d60f · outbound

This paper cites Sentinel: Efficient tensor migration and allocation on heteroge- neous memory systems for deep learning.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Sentinel: Efficient tensor migration and allocation on heteroge- neous memory systems for deep learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.162093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.162093Z digest=sha256:ca9a958a041e493037a17b6f84bcd5dd1e68495ddc76800c79b8703a26629057

Observation 6b689f6b-2dca-4230-9d7c-9976f561fe33 · outbound

This paper cites ZeRO-Offload: Democratizing Billion-Scale model training.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences ZeRO-Offload: Democratizing Billion-Scale model training

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.164630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.164630Z digest=sha256:fbe72e4c00d6033ebc7541da7b8ba177ee31f3b30574e67cde29db784c019637

Observation 093ce6c5-fe1c-4f2b-a3c8-896e179120dd · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.166905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.166905Z digest=sha256:a1c672789bb84d5c088ef51c57a76e82ad245ffeb3e53ec52b30cfede048fd5e

Observation ba47f7de-9267-43e5-a731-1ddbffb5a420 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.169725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.169725Z digest=sha256:e1b5a33976a08573e67616edad4a92e1c76c0ea4a986c3dc06b17cf98a800b10

Observation fd02899f-e2d0-4484-92e4-04d008c6d704 · outbound

This paper cites Cntk: Microsoft’s open-source deep- learning toolkit.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Cntk: Microsoft’s open-source deep- learning toolkit

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.172166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.172166Z digest=sha256:1b896d6d8d54b9d2083a07a58269266759381d6ed94207e3ed6423ce37377551

Observation 3efdc510-6f06-4b0c-b126-ec89b2d1038c · outbound

This paper cites Neural machine translation of rare words with subword units, 2016.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Neural machine translation of rare words with subword units, 2016

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.174582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.174582Z digest=sha256:38a7d08af8525670b07dff0c5a7ab073815abe01dd31cd576577449df3752d9d

Observation 328f9522-c21b-4049-937f-8db6f5e0747e · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.177018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.177018Z digest=sha256:082423e96a2a48da22612ab88305618fb403c079c1cbe551b9c901ae6fdd6adf

Observation 63e9c211-9b63-49fa-b2d5-cf73a98b25f1 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.179849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.179849Z digest=sha256:9ffc931dd268ab934e1c88a1f793bf2795fcf686777fdabb6ce16c760cf8a949

Observation d197b74b-c442-4dca-9805-c1495afc1e26 · outbound

This paper cites Bamboo: Making preemptible instances resilient for affordable training of large DNNs.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Bamboo: Making preemptible instances resilient for affordable training of large DNNs

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.182455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.182455Z digest=sha256:96c9150801877c364091458e485f8558f722bc134ef0f4b898738548318230c1

Observation 4155000a-7a13-4a9d-8bcf-a9f4bbcfafd3 · outbound

This paper cites Superneurons: dynamic gpu memory management for training deep neural networks.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Superneurons: dynamic gpu memory management for training deep neural networks

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.185140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.185140Z digest=sha256:552b462ec08843e7f09a6fc15bfc4936d3cdb96d15cf880e58452bc48f64fa08

Observation 152ffe27-0bca-4fe3-902c-ff49c1742f05 · outbound

This paper cites Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.187720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.187720Z digest=sha256:2f970391e8563a83349200c3777b9c375fa5d7bfbac15db58ced429417e3b825

Observation 69cc361f-fde4-42be-bfaf-7a27b74d9724 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.190328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.190328Z digest=sha256:b3f080241b082c325de3ee0f87c0c692d95410b98478e6e8f0639839d51b0e5e

Observation 933fbcee-59db-412d-829e-dd2240db6f7d · outbound

This paper cites Accelerating the training of large language models using efficient activation rematerialization and optimal hybrid parallelism.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Accelerating the training of large language models using efficient activation rematerialization and optimal hybrid parallelism

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.192805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.192805Z digest=sha256:7492dc2cbfbabcd93f74219bdc390cd58923dd845573d4c185cdeef78de9ab8d

Observation 788b3f30-19de-46ae-bb15-efcf0b91e973 · outbound

This paper cites Pytorch fsdp: Experiences on scaling fully sharded data parallel.Proc.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Pytorch fsdp: Experiences on scaling fully sharded data parallel.Proc

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.195329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.195329Z digest=sha256:c337d15c381ff9d5a230a7aafead7ea28a83ee00925939869d4ac896e4e42242

Observation eae79eea-5b24-4664-adc3-0160a0de8350 · outbound

This paper cites an unresolved cited work.

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences Unresolved cited work

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T17:12:42.076571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:12:42.076571Z digest=sha256:a9bfdaabf3cbe5246229f820eb65cd16a3068f589b75d637d628ec48e4298e30

Pith citing papers

No inbound Pith citation observations are available.