{"as_of":"2026-08-20T19:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5acfa333287c7953f8b6cb303527b272bfdc1e0ed02e317329a86294ab0537be","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:31:27.783419Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30728/citation-record","integrity":"/paper/2605.30728/integrity","json":"/paper/2605.30728/citation-record.json","paper":"/paper/2605.30728"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https: //docs.nvidia.com/cuda/cuda-c-programming-guide#compressible- memory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:22020529a19022b996c478ee72cb1b07028baf541a440c70c9fe9779ed62e279","observation_id":"58be9c57-58c9-4bc0-9f23-453c20e8f45a","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://docs.nvidia.com/cuda/cuda-c-programming-guide/#device- memory-accesses","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:cfa96d806d15868233006adacde0be358581211f42ae21b079f1d3e09cc40578","observation_id":"480b1c84-24c2-46a0-825c-395fcf9625ae","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://docs.nvidia.com/cuda/cuda-c-programming- guide/#hardware-implementation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:6f50c46a4566d880970962186909538ec870a22ef15b7dcbd4365f7aab3ae8e3","observation_id":"fd5618a2-0317-459a-ac84-e1571df69b9a","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://docs.nvidia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:39797573ab05eec64a7ee5bccccd453bcedf19b98da0f1092d01f9b734f87115","observation_id":"c6ce86f4-3a34-4b03-85e4-44e725cd109d","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://catalog.ngc.nvidia.com/orgs/nvidia/teams/ dle/models/dlrm_base_tf2_ckpt_ds-criteo-fl15","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:d19e5f3d4fb67be6f345697891d02b9de6a0e630e4461858849d9bb3db4b1183","observation_id":"edd49fed-8a93-4b38-b361-70fe5cd6f868","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https:// developer.nvidia.com/nvcomp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:f03591d9d83235739df31b67ee49487d2d7124ba54f6d21e4e4106034a33432d","observation_id":"e3f46a52-7d0d-48ce-9f6d-4b13a972d88f","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:9ced8708fc424cff121213ec0d8c873e421dc7039dcd80dae305f89a9685a704","observation_id":"9421c787-6802-4ed6-91f7-9811c919da51","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://resources.nvidia.com/en-us- tensor-core/nvidia-tensor-core-gpu-datasheet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:7b6192ef0ffd20b855bde9783e811cd1c41a914396384d7ca58de5b645e7ba2a","observation_id":"fb1ede28-9520-4da8-93f0-304e4d149a7a","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://images.nvidia.com/content/ technologies/volta/pdf/volta-v100-datasheet-update-us-1165301- r5.pdf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:f3f04bdc704035585923bc648812fabf2cb95a3725032d27220eb664f492de5a","observation_id":"d811ba6d-25ec-41ca-8a15-f0e29468fd74","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://www.nvidia.com/en-in/data-center/ nvlink/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:671b2277e29f04bfaa1df1526fc12f17a68ae5b67305e68eecfdbd9d6129e738","observation_id":"c244c94d-5fa2-49c1-923d-becefcb4df64","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"https://labs.criteo.com/2013/12/download- terabyte-click-logs-2/","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:aee16aa0392504dae58047055f92a7671bbe101c8058d51e3da98739b65961fc","observation_id":"933516ca-e192-4959-9604-4ca54d7e8e01","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Understanding training efficiency of deep learning recommendation models at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:39a65b119d221567450cb8f7fcc8c99c84c699bee08b87c52c4e5d7def8fca42","observation_id":"fc2e4bdc-ca83-411b-bb8d-6dfa9371be66","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Accelerating gpu data processing using fastlanes compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:02bd032cabfd85743b8ab43dba6a6da92ef92d92ccaa7592a2218d7a51b7fdf3","observation_id":"5c138396-e6c8-4561-8843-48da8f83ef8c","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Bagpipe: Accelerating deep recommendation model training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:4ca76a1e05d86a92ea63784b9866b783749998a5da35674b1a2a417188b29bd5","observation_id":"d74e3866-f4d7-4aa5-8b46-90a9e0cb6582","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Graph neural network training systems: A performance comparison of full-graph and mini-batch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:45478f2aaa30c4ebad4a9363916e76956cd04f4c87724df1b083019e950185ee","observation_id":"78f89cf1-d351-4faa-8a8e-0d06b1ffe084","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Aware: Workload-aware, redundancy-exploiting linear algebra","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:f8593b4f2403b371f23e7c9e7755d3616a640aa1e885fce2c144b84de2d39109","observation_id":"eff29eb0-b998-453a-842d-b52dbb8b014e","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Deep gaussian embedding of graphs: Unsupervised inductive learning via ranking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e1715b536fef4c2ee796c1481f142aa53192dfae684fb6e92c9ab2046861324b","observation_id":"789f85ef-ebca-4da1-b721-e1a34d2b3bea","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Molecular generative graph neural networks for drug discovery.Neurocomputing, 450:242–252, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:2a32a0b8172d1fec2e531ce478631f7fb3309328b3199c6d5c97f1a122bb1487","observation_id":"3abfc8c3-2f8a-427a-9b8f-9b01c21cd119","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Fcbench: Cross-domain benchmarking of lossless compression for floating-point data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:f821979c0076249b6eaafe1ac2a0f63c1d5fd1d125782e86b4360f0fad5a4a15","observation_id":"7d4e8955-bfff-4347-94b6-fcd9a52d7157","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Learned image compression with discretized gaussian mixture likeli- hoods and attention modules","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:1b345b61e0199550dec3f0b2f0797c86270cfdeecbb4d76eb335df65192267db","observation_id":"db428f5c-016d-426f-bbfc-03506bdcd199","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"The trade-offs of model size in large recommendation models : 100gb to 10mb criteo-tb dlrm model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:3bb7c9a7a1a2ce8aea25a0a0dc23d0b4eaa1dae68b84f72b4518cf58bb47fef1","observation_id":"0839d043-6779-4dd2-a5cd-91caea7330ea","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Gpt3.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:ae001cd068a9a4da38004c8d1c850902b954249b15d560ac90bdd9d6b85a719b","observation_id":"e3425b2b-04c2-49db-85a9-76a9451c2f02","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:49244a2f2a6703cf6ec8a594a51470a923799b8e6ddeb77de8abb48ea8759418","observation_id":"7ad0f06f-e73c-455e-a7e8-b6fd9441dfe8","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Accuracy is not all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:184e98a0a867bfc63ef3484c3cce686c41e7cd19c66012fd851b521c2b28bdb6","observation_id":"05a7fad3-6c85-4f36-99cf-b3fba532ce35","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Haas, Frederick R","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:c87901a752c9bfb7fcbff39e2019d97913bdde79b41d8f188916eac0e329bcf4","observation_id":"3f38b486-b791-47bf-95d4-8253d4e00fd9","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Zipserv: Fast and memory-efficient llm inference with hardware-aware lossless compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:1477d6708db724cb3fe997ff564b23186eeb53182c00894f257a299606af54a6","observation_id":"774f680c-1754-45d6-be16-5237fb861c2b","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05321","last_updated":"2022-08-08T12:08:05Z","snapshot_observed_at":"2026-08-19T08:01:39.471048Z","submitted_at":"2022-08-08T12:08:05Z","title":"A Frequency-aware Software Cache for Large Recommendation System Embeddings","version":1},"cited_work":{"arxiv_id":"2208.05321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.05321","snapshot_observed_at":"2026-06-28T23:32:46.927071Z","title":"A frequency-aware software cache for large recommendation system embeddings","venue":null,"work_id":"d68293b5-fb75-4a5a-b5e4-1b8891df107d","year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"cited_paper":"/paper/2208.05321","citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e27162415273d6474d8a3ea4a1c1e71323f3b986a02165a7182571855b7f9f25","observation_id":"a8d4e7e4-6dd8-4ec6-ba07-e17ee40e0cd7","resolution":{"observed_at":"2026-06-28T23:32:46.928700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Sahu, Marco Canini, and Amedeo Sapio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:3994e8e33b41cc94689a7bafcf7c78531842036612c5d0deb7889911a41c1e51","observation_id":"d956aa1e-e3d1-4c1d-81da-2739e64cccf0","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Accelerating Communication in Deep Learning Recommendation Model Training with Dual-Level Adaptive Lossy Compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:6f8a0f89a44691541f681ef960a9b3f3564af9ca76f930beb5091670ec76e21a","observation_id":"3460820b-b559-4f5c-b189-27e3f38ae811","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:be3030627d7c7226bc284bb5395240f8e7cdba75832c34ad004dd68647029fda","observation_id":"45aa004e-7674-4d6a-920c-977a87340210","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Lee, David Brooks, and Carole- Jean Wu","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:22dac8510816e020bf740c73035a60a12e8671bbd9b93e61558df70a9d7bb046","observation_id":"e78ee4b7-bc97-4783-a6f0-1747a1a7a707","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Inductive representa- tion learning on large graphs","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:10a08f8444d9774d1bf3d16d6cfde544da59d15196a90737593482fd15d36ffa","observation_id":"81c6980d-5dec-4d42-aec9-338892be3f14","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"How to optimize data transfers in cuda c/c++","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:d9a34676f61e83ef1210e891151adbe034247994c8dc19616a6cd486f991df18","observation_id":"7905fbc9-36b0-4c2e-a9d4-335cc43ea1ab","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Natural compression for distributed deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:2f31be9b57de42946c305e747a56115ba5552814a503b979ee54c65d5f0302f6","observation_id":"3958feea-a664-4238-be44-abe85260ca37","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Open graph benchmark: Datasets for machine learning on graphs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:9e4252b1d4031c5357e6e3ff4b995db9174f2cb98e1c50f6c11b81f5ac5481af","observation_id":"f32cc364-16fd-41b4-8f85-ca1632d963b2","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e241c9f282e2422ee758c72dbaa610f2fae1a13e87a9d9e70d32b40e66d64127","observation_id":"b4d4085d-2806-4c81-aade-4ba18d4596ca","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Grow: A row-stationary sparse-dense gemm accelerator for memory-efficient graph convolutional neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:226a695b46963fcfb231ff74a64e9645d8680ea3bbd79567436f81f33b7ccf94","observation_id":"0d3aa107-1505-4a63-8729-ea11f554b084","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"An extended compression format for the optimization of sparse matrix-vector multiplication.IEEE Trans- actions on Parallel and Distributed Systems , 24(10):1930–1940, October 2013","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:68b1aee8334e29452c7107a6ce8e057dd118b46df0eed54e4a439e74c97ec693","observation_id":"ee1a08a2-4a0f-446b-bceb-801e6129435d","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Tensorfloat-32 in the a100 gpu accelerates ai training, hpc up to 20x","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:55f429fd639ada6de5c665d8df8ff4abd2a9b88652047cc9e7701483acd7ee3a","observation_id":"76a167d5-cc2c-45f5-bcfa-bb4e648c50f5","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Datasets for benchmarking floating-point compressors, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:a5f8f2b457cbc3a86225ccc507b5d7323d80d8897aa8439722394e4734239a50","observation_id":"1d3ae069-df77-43e2-99ae-2a4a9b7fbd28","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"ndzip-gpu: ef- ficient lossless compression of scientific floating-point data on gpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:b8cdffa83ad635a81ffa0f8f58a2e446af33e53018d2e02f254ad58ca13d9a3a","observation_id":"4fa23bbb-2e43-410b-9024-6e9e46c9b815","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Webb, Xin Wang, Marcel Nassar, Arjun K","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:0b23325fc8e06cbad24ce14021a8590994692276c7bf96a15a7ec3c6631c64f5","observation_id":"fd6c6375-e65d-4a89-b5dc-47e929ce8943","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Splitrpc: A Control + Data path splitting rpc stack for ml inference serving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:c3fbeecbb87cd98256348120605df8ef5288d294343df3d0e5d6498c132d0d64","observation_id":"06166886-e07d-4b9f-b8b1-41d2e548f4e2","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:ea5542208c53297052b665071e2eb57d26113939f29cddf3c2456af8c163235d","observation_id":"243aeb13-81db-4714-aa62-4c1739260fe1","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"InfiniGen: Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:db111c5dbd7b8769f861fa9062bb6e59c8a1b7f246929287779a4b2f30f8338b","observation_id":"90515bfd-b669-44db-8b7c-527daed8ff94","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Naughton, and Jignesh M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:25d8f76f2c52474a684d1f16bc9ea0f754655e97929bf30ed310658de0ae4f87","observation_id":"7eaa13f5-e8f6-4bf1-a4f2-e39cd06a4583","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"THC: Accelerating Distributed Deep Learning Using Tensor Homomorphic Compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:5967ca7311e0d4a845ae8660e60063de22125087a843d4dd58408c9e8630cd27","observation_id":"b6dc5995-db65-4a6b-a31b-5787a22441c2","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Colossal-ai: A unified deep learning system for large-scale parallel training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:109a2acf9cca5b8d10091221c50b0bdfb128d1fa989484ac752d195c8735724d","observation_id":"47b697ea-fe90-4f34-bb49-121875260143","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:ca8e070f091dc814a9bddff659ec626d75989c7df339741cfc6bb3a0b191f410","observation_id":"c1fcb082-3cb3-438b-bc1b-015b8b5c7786","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Recoil: Parallel rans decoding with decoder-adaptive scalability","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:7189bfba249de7dbfc475f0a5a7b6e0cb28827bb8f13c8dc3bff51c8003ad9c4","observation_id":"64a46fc8-ccb1-425b-9cdd-73fd58363cc9","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Using cuda warp-level primitives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:154d37370d943bbf9c3f0d477470131d636f3ebca9834ecf67d8d2f6840c4705","observation_id":"e858a7ae-6d0c-4d64-ae23-29f83b8b43ca","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:c5c2b543ac87d35e14f3302b791d220b52a5efda3f594ebe1c53abc4d8f50bdf","observation_id":"a6cb9f79-afc7-4fb5-a368-35b07155cdde","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Pa- graph: Scaling gnn training on large graphs via computation-aware caching","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:40308a553f7d3e6ed6cc2f9d8774309230998f332751d8f2a28ecec762e0f9a9","observation_id":"ccb87448-fd90-4747-a8ab-632fcd89b0f9","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Indigo: Gnn-based inductive knowledge graph completion using pair-wise encoding","venue":null,"work_id":null,"year":2034},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e7e0273e8a3e467552cda92bbbdf8fb5ceef04534a33bc5f75257620ad63bc33","observation_id":"03c8a26e-a4e1-4b31-b86e-e6d0ba77c44b","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"BGL: GPU-Efficient GNN training by optimizing graph data I/O and preprocessing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:37d49b8f0facfa3372a35732beafa8dce96e7577e315ff99b79f9f731452cf42","observation_id":"5ba372c9-549c-4169-8b4e-ac1574d381ad","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Pick and choose: A gnn-based imbalanced learning approach for fraud detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:bbc3fb86f05409b07c647c866a451313b45eb511b2a59061889c41ef1a032d92","observation_id":"7acec39a-9a2e-47b7-8801-4e1dc12cf63c","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:969e6f242902cd6a15abac86233ce5d98f73985212694e75290edd1dfec01205","observation_id":"388b03f8-fa5f-4a2f-bf1b-13e7391b0bd3","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Dvc: An end-to-end deep video compression framework","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:d16a41ef00565e3c411e08e74bd448c59c83a96f5c3c2d2d08a55769bfb4af12","observation_id":"30868c71-8ae6-494c-8488-2327e840b407","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Eliminating data processing bottlenecks in gnn training over large graphs via two-level feature compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:68767258a320d90d9f39217824d9adce149f726c56bf1f15c6918d7aa399a103","observation_id":"f31eabe6-84e5-4a95-a311-e0ccba012da0","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14696","last_updated":"2023-02-17T15:44:08Z","snapshot_observed_at":"2026-08-16T16:42:26.341451Z","submitted_at":"2022-07-29T14:07:35Z","title":"BiFeat: Supercharge GNN Training via Graph Feature Quantization","version":2},"cited_work":{"arxiv_id":"2207.14696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.14696","snapshot_observed_at":"2026-06-28T23:32:46.921539Z","title":"Bifeat: Supercharge gnn training via graph feature quantization","venue":null,"work_id":"2bf3e513-ba08-4547-b8f1-222e5651b0c7","year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"cited_paper":"/paper/2207.14696","citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:242bfb81404406c633b9041b05fcb941487ce650e40e4a5287f4faa87238df5f","observation_id":"ff28a625-a2f4-4629-a8ad-a492ad724d7e","resolution":{"observed_at":"2026-06-28T23:32:46.922930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Emogi: efficient memory- access for out-of-memory graph-traversal in gpus","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:8fadd03cd8e6fcc7c33a4dda0af27f623b460e22acb370bf6de0be39c83cd381","observation_id":"53c41487-f68c-4495-8354-554d37f3d024","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:32d6c6f59d807f9fd8adb2ae25fe2af1b1bb8a9eca2be537f9812b41c4a27ebe","observation_id":"434671fd-1b3a-4c62-b9fb-e90ecab31030","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:56ab8798e1ff519e81035e696c20c4bfcb9c02c090fc37261eda89e079c53e57","observation_id":"a40dea05-0faf-480b-855c-9f5d5ae8d850","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Query-driven active surveying for collective classification","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:2f93c5f34feb722bc252dc4415fa94180bfbf35a93f56ad3361b671059bc992c","observation_id":"9ddab374-b9a9-4f7e-b610-fe31c9c53caf","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Patel, Yao Zhang, Jason Mak, Andrew Davidson, and John D","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:33988a75e5f48a250880f7befbd9118cc97a9f1d3a0a8beb75c66894d1931338","observation_id":"a783d1e3-caea-43f3-ad0a-34df0e53354b","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Gpu-initiated on-demand high-throughput storage access in the BaM system architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:bc24db8708f9f491b2bf587b9693f21464e500caa6d560ccb71c56ba7b56b260","observation_id":"d23c0cfd-cc64-49aa-93f4-70d90dca7ff1","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Real-time adaptive image com- pression","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:2ccb7c95be55f4059b7e1614dcbfeb9cda9e01285f12ced2ba37f4e4d095c891","observation_id":"875c4bd6-3e20-4484-908b-de79aaf456c4","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Faster across the pcie bus: a gpu library for lightweight decompression: including support for patched compression schemes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:d61ee0f7996193a7bc2a01ee464c37b48af45b22cec7e76637294ef2b063ca39","observation_id":"45c77b34-affa-4749-a7f1-afb9083063b4","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Collective classification in network data","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:aee4ff76070898f0cb60810d4418efdac3485c485495afe877012000aaae85a3","observation_id":"7715261c-b98c-4ec9-ad5b-28f4e732f1c0","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Scalable graph neural network training: The case for sampling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:776e7c720333b11c75b8f794c64fc6374f46bc026b40ce6d576fbc30694a28c4","observation_id":"40d51d3c-ae4f-411f-b3ba-80e68ee7f4af","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Yogatama, Xiangyao Yu, and Samuel Madden","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:8ad06b1e64d85073a70d4e04a92201b0e8a8a52898bdb66f23ca3eb961715f16","observation_id":"31c0e8c1-c916-442d-bc98-09c0c76c1955","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"FlexGen: High-throughput generative inference of large language mod- els with a single GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:c6f31c75bac9313801fb02345538cf0ae84db0b4dc991adb08e5c1382049efd4","observation_id":"9bc214dc-efb8-431b-8baf-4a2289901aea","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Ugache: A unified gpu cache for embedding-based deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:0c1b6a46bd5e9447b89ac1820225a46c66903759bfdc4e421beb2720f0e7c745","observation_id":"dff30bca-721a-445c-bbfc-4963b008c41c","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e93d84b83d3911626d286e28ca923e81c07813bbb902895621764efeec803231","observation_id":"649b7f85-b853-4efb-b489-f0fee07b7797","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Legion: Automatically pushing the envelope of Multi-GPU system for Billion- Scale GNN training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:2ff08c0f2891cfeeb3785dc00b2b0e85d6f4b4ab71344061812b1d96b655a246","observation_id":"bc495989-c00e-4e7a-8b4b-75abe4291eb5","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Controlling data move- ment to boost performance on the nvidia ampere architec- ture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:74c9664525ce51b3d5ca34d1ac3cc65b10a8b8535e60d7252d6a4c4d35190814","observation_id":"c82750b2-14ce-4140-8579-06f10d847d15","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:c5a52961a0a74a8150d1f6ab69d42c03162e95f69fa7a6296e90afea434043a2","observation_id":"8789fc65-98b0-4656-9cf7-eea646aaa210","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:70c4a2a90f64a81d364a0f4c600c13ceaf232216631e2450095858a01d235308","observation_id":"f0c47773-57e0-413e-b0f5-0bd4c64c23c7","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Mariusgnn: Resource-efficient out-of-core training of graph neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:3230d0c0d47825e39238dc3dd6deef29195c260ba0039a41eee0a236e2eed258","observation_id":"55836ff8-7788-4019-bbd9-e5dad7699ef4","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"ZeRO++: Extremely Efficient Collective Communication for Large Model Training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:18276e2a21e4983171ddc9e12b92c533ed46e80784f9bb7196d52a71831041cc","observation_id":"4931efc0-0154-4b32-ac72-10a779bb8be0","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01315","last_updated":"2020-08-25T15:46:13Z","snapshot_observed_at":"2026-08-18T10:54:34.717319Z","submitted_at":"2019-09-03T17:10:28Z","title":"Deep Graph Library: A Graph-Centric, Highly-Performant Package for Graph Neural Networks","version":2},"cited_work":{"arxiv_id":"1909.01315","doi":"10.1109/jproc.2015.2494218","metadata_source":"pith","pith_arxiv_id":"1909.01315","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Graph Library: A Graph-Centric, Highly-Performant Package for Graph Neural Networks","venue":"cs.LG","work_id":"cda59fa8-5a85-49bd-97eb-af4eb18ec95a","year":2019},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"cited_paper":"/paper/1909.01315","citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e4fc1535bb7a316f7d20fa0b7181761a79fce14590c18082265e6d714d745195","observation_id":"00eb0ab9-8e4e-4cf3-a011-439056655ce0","resolution":{"observed_at":"2026-06-28T23:32:46.920362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T04:50:27.149977+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T04:50:27.149977+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Bfloat16: The secret to high per- formance on cloud tpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:29c94a3f96c2ce1fd3ccb404e9de5f0a208473a844a6d019303a71833b6820aa","observation_id":"da586fe3-1ab0-4b7a-a99d-78cd59d14e5f","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"A gpu-specialized inference parameter server for large-scale deep recommendation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:85d4d3cfa60bce801971a287770c7d607a27ae4859f8797b13b865e630fbebef","observation_id":"161265b2-6c2f-4a08-9bf7-aab0bd0725e6","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Massively parallel inverse block-sorting transforms for bzip2 decompression on gpus","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:1ad8cc5963968e989da0d1bc2ed4f7f915b1f95a8a8f169d9d2ca864883c8838","observation_id":"edbd7f26-0ea9-4e15-9a5e-ff92b4e015c1","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"MLaaS in the wild: Workload analysis and scheduling in Large-Scale heterogeneous GPU clusters","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:069cfe0bd56fb74bc682d06bf7f6c9610f0a76f0d880b18082925cb07dc877c8","observation_id":"8bb53cea-deb6-4830-9a7e-aa3763d5216c","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Widrow, I","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:37a1a0508a5bd7f4fef9c431f4bd645c62eab48c45d6827fd57595c2e5044b53","observation_id":"964e1d95-68d8-493f-b387-4e513ce72c62","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Abdelmoniem, Aritra Dutta, El Houcine Bergou, Konstantinos Karatsenidis, Marco Canini, and Panos Kalnis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:a56fcb0c8d442b1030788fabbb7bc82eeb5366a35a182adfb34bb404c000aaea","observation_id":"b088b425-1ec4-4f1a-8d78-9d937a094051","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Mpc: A massively parallel compression algorithm for scientific data","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:5e014d69df36de991d6667c0fcd745ea3322486a504005c4656456eeaf4b5bd7","observation_id":"5ec46941-92f6-4096-842c-4c0cab3a09d4","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Gnnlab: a factored system for sample-based gnn training over gpus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:1c5b56f6ae2fdfd4619af79aba6a242a1e2d222a73aa026169a5d41dbf355c68","observation_id":"1917737e-b805-4d3b-aadf-ea01c6e07444","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Lossy image compression with conditional diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:84804e8166b23f7a61882bd259685fdefd03936a83ec560a7cafcc6384ae149c","observation_id":"1a6698af-23dc-441c-afae-4f51cc6da5d4","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Spargnn: Efficient joint feature-model sparsity exploitation in graph neural network acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:74bc7596167d2a387c1eedc3c15928c621afe69fb895a114570bbf98f1f6e0be","observation_id":"dca569c2-248b-4097-8a2f-653f38319afb","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Hamilton, and Jure Leskovec","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:53b6b9a338ded74b355df293e0093b749ee852fdd1a324fdaae74100eb2fe205","observation_id":"eade4f5c-45c0-40b5-9621-65cb4722a893","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"SGCN: Exploiting Compressed-Sparse Features in Deep Graph Convolutional Network Accelerators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:8ad51f2e4f96cc8d71f86face7847a0ab0f98e48e642fcca531dcc9f23dce097","observation_id":"66ca2141-80e0-472f-848b-0594027d9ac1","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:9f7c2666e982873e1b625d14de648ebd1653a887ff24093449ce7a6f338f5bc1","observation_id":"e9c02e50-0c37-451d-8f89-9bd62460bc61","resolution":{"observed_at":"2026-06-28T23:32:46.931201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"70% size, 100% accuracy: Lossless LLM compression for efficient GPU inference via dynamic- length float (DFloat11)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:718d4b486e34a7de870038bf135c804b0ca42d5f12a14620c1ce54e23bbe8166","observation_id":"b2dfe8ad-33e0-41a5-a700-4c19e1ebb98f","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Ducati: A dual- cache training system for graph neural networks on giant graphs with the gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:7da1c4bcace423341f4586b550bb6d61e5c90742e33776c96414ffa9470d0253","observation_id":"942f0507-fa9a-4a9a-9730-f7b5dc42558d","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"H2o: heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:7df0170ea5c00e88edc16a6aa2894b9de18be4a80ba21fd0bcb75b9b791c9f57","observation_id":"08442e00-035e-479c-a085-b7b29f8f283e","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Silod: A co-design of caching and scheduling for deep learning clusters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:a9c67093278b8e7682f0d3db7848f33d5ecc9292ac4c331e05db4877a6643fc0","observation_id":"54eaea14-c732-4b68-81c6-b33253925b5f","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:31:27.783419Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:e8d8da8ca3666eece3edf3b306ccbbf78abd45ce462a5d76ce0a94774f985c58","observation_id":"95e2f71d-3e78-405c-bfad-436a4651580c","resolution":{"observed_at":"2026-06-28T23:31:27.783419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1886904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:32:46.924297Z","title":"${CONDA_PREFIX}","venue":null,"work_id":"27d28694-3e12-48dd-a1a2-fd37ff2f8299","year":2026},"citing_paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-28T23:31:27.783419Z"},"links":{"citing_paper":"/paper/2605.30728"},"observation_digest":"sha256:d527735879ebbd65d992bd62ddd6349601c717cca245934f3f6fbcece40b8d50","observation_id":"d4739a5d-6675-43b4-b467-68655052e63a","resolution":{"observed_at":"2026-06-28T23:32:46.925804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.30728","last_updated":"2026-05-29T01:45:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T13:17:53.173514Z","submitted_at":"2026-05-29T01:45:28Z","title":"Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 0 inbound Pith citation observations for arXiv:2605.30728."}