{"as_of":"2026-08-09T14:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:709f95e37bcd3bd3c7be735fb5ae1a364b217005b28e020bcf4c05204e292790","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:23:34.861574Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-05-15T09:51:46.701149Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2202.12837"},"observation_digest":"sha256:a44fbfdb7d29b1a8fb2564f5468fe29626b58396d113fa38c19bc1cf5a9821e4","observation_id":"ddd28ee3-33c2-46e9-9363-080b227bd50a","resolution":{"observed_at":"2026-05-15T09:51:46.844616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:34440a0823c596f5bb9e216652436dd3a007d42e823bb4959a78763f22a48ccc","observation_id":"80ea1a75-f208-4640-a79c-4e6dd5496c74","resolution":{"observed_at":"2026-05-23T05:57:36.672293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2501.17549","last_updated":"2026-05-18T07:20:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T10:35:41Z","title":"Query-Aware Learnable Graph Pooling Tokens as Prompt for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:36:06.247071Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2501.17549"},"observation_digest":"sha256:0abf96dd599e883d922a1b7fa82c44f158f1c41d9d7a28c2ad8d3d4e47848e15","observation_id":"10c0fdfc-4e48-4586-bc29-41a1ab6ee0f0","resolution":{"observed_at":"2026-05-23T04:37:32.089763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-09T04:23:34.861574Z","title":"8-bit optimizers via block-wise quantization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03617","last_updated":"2025-02-05T21:06:30Z","snapshot_observed_at":"2026-08-09T13:43:47.719527Z","submitted_at":"2025-02-05T21:06:30Z","title":"Resource-Efficient & Effective Code Summarization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T04:23:34.861574Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2502.03617"},"observation_digest":"sha256:f1627d6c5943723ae31bc554cfb9b4960b728d286692f90dd6fb3099406f46bb","observation_id":"06501bb7-f57a-4160-87d8-217e03c47c00","resolution":{"observed_at":"2026-08-09T04:23:34.861574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-08T19:01:09.214424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05539","last_updated":"2025-02-08T12:06:58Z","snapshot_observed_at":"2026-08-09T02:58:47.825372Z","submitted_at":"2025-02-08T12:06:58Z","title":"SSH: Sparse Spectrum Adaptation via Discrete Hartley Transformation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T19:01:09.214424Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2502.05539"},"observation_digest":"sha256:3ace2940f92c3e50396f9a3237046751d7af9329c1d14760e049b4dfb2911c77","observation_id":"b6f0a2ef-2891-483c-8653-7110ecacb8e6","resolution":{"observed_at":"2026-08-08T19:01:09.214424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T15:43:37.149873Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14742","last_updated":"2025-05-29T22:04:36Z","snapshot_observed_at":"2026-08-09T14:33:06.239071Z","submitted_at":"2025-05-20T07:19:36Z","title":"Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:37.149873Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2505.14742"},"observation_digest":"sha256:cc4811fa69f2e7e8c0257f65659f461a2c4ffbe191c85257bd5dd75ed2b215eb","observation_id":"e64fa1bc-0016-42d3-8344-8e797838f702","resolution":{"observed_at":"2026-08-07T15:43:37.149873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T15:16:00.585372Z","title":"8-bit optimizers via block-wise quantization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17116","last_updated":"2025-05-21T16:27:51Z","snapshot_observed_at":"2026-08-08T04:05:44.729912Z","submitted_at":"2025-05-21T16:27:51Z","title":"Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:16:00.585372Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2505.17116"},"observation_digest":"sha256:a06cd6684678bc5085df3a63cc99e4040642ad0d303c58f3622f3d5af89afee3","observation_id":"1d85fe88-6af5-4a02-a9ad-a0323c9912d8","resolution":{"observed_at":"2026-08-07T15:16:00.585372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T11:55:13.250462Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.250462Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:5071c1c8dac413fcf59942a0d76dcd190cee2295da0a1ddea6109eacf3b281fa","observation_id":"f320d63e-c91c-46e4-9a45-535ee198c85f","resolution":{"observed_at":"2026-08-07T11:55:13.250462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T10:42:23.400254Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04603","last_updated":"2025-06-05T03:40:57Z","snapshot_observed_at":"2026-08-07T10:35:43.791290Z","submitted_at":"2025-06-05T03:40:57Z","title":"A MISMATCHED Benchmark for Scientific Natural Language Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:23.400254Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.04603"},"observation_digest":"sha256:fe1bcde7ced3467dabaa2bcfbb3aa424d2c066add7343cfe6df5fb512a54ba84","observation_id":"46ab0f85-5288-406a-9555-ca4a273f1bd3","resolution":{"observed_at":"2026-08-07T10:42:23.400254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T04:19:41.968247Z","title":"Dettmers, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10885","last_updated":"2025-06-12T16:49:40Z","snapshot_observed_at":"2026-08-09T05:55:07.421658Z","submitted_at":"2025-06-12T16:49:40Z","title":"Slimming Down LLMs Without Losing Their Minds","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:19:41.968247Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.10885"},"observation_digest":"sha256:1b5e8ef087fa6d48951d6ccf66f253982822a1ba3c9bb2883ec32fe0d8e181bc","observation_id":"f082671f-8362-49d4-9d86-5122c2bd84f8","resolution":{"observed_at":"2026-08-07T04:19:41.968247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-06T18:35:40.111493Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-08T23:54:01.601611Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.111493Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:078d03c8366b0ac41a43562b7dc44e8ed67f810bcfe5712c03df97775697e61d","observation_id":"37add5ea-1f3f-4a0b-8e0b-d16bbe160b7b","resolution":{"observed_at":"2026-08-06T18:35:40.111493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-06T17:56:21.261233Z","title":"8-bit optimizers via block-wise quantization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09665","last_updated":"2025-07-13T14:58:19Z","snapshot_observed_at":"2026-08-08T22:10:15.646478Z","submitted_at":"2025-07-13T14:58:19Z","title":"Is Quantization a Deal-breaker? Empirical Insights from Large Code Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:56:21.261233Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2507.09665"},"observation_digest":"sha256:f680a2b6af25e72d297034890a4d3388d9886db8b24e5ef1433643f45796c83e","observation_id":"2c8cc62a-b52d-42d7-8929-54e27d22a9fa","resolution":{"observed_at":"2026-08-06T17:56:21.261233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T15:10:34.440764Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.440764Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:3a4a8abde9d22d35239236e2028b4fcdd88d8e05099637c1c7db58669a3b7290","observation_id":"19effd8d-d214-47d5-95bf-bc6f0dd197a3","resolution":{"observed_at":"2026-08-05T15:10:34.440764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T10:38:35.001738Z","title":"& Zettlemoyer, L","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04534","last_updated":"2025-09-04T04:18:45Z","snapshot_observed_at":"2026-08-06T05:31:52.923420Z","submitted_at":"2025-09-04T04:18:45Z","title":"Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:35.001738Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2509.04534"},"observation_digest":"sha256:ade30944cf9e7ba725509b1779acbf3936ab8ee575fc0745f3c31edf247d0c6f","observation_id":"ebfa13f1-ea5b-4b2e-b086-13096f9b453b","resolution":{"observed_at":"2026-08-05T10:38:35.001738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2510.25977","last_updated":"2026-04-23T22:27:02Z","snapshot_observed_at":"2026-08-02T11:49:00.583840Z","submitted_at":"2025-10-29T21:22:08Z","title":"NeuronMLP: Efficient LLM Inference via Singular Value Decomposition Compression and Tiling on AWS Trainium","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T02:51:19.275111Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2510.25977"},"observation_digest":"sha256:8f16bb0cc04c3d6e1b55ddd121779c16c735e82fb857c9a6271e6073dbd1a572","observation_id":"b1810150-1745-434f-8810-5bcf97bc4d58","resolution":{"observed_at":"2026-05-18T02:52:21.861968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2512.12677","last_updated":"2026-05-25T16:57:18Z","snapshot_observed_at":"2026-08-03T16:38:10.732856Z","submitted_at":"2025-12-14T13:02:06Z","title":"Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T07:23:53.703286Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2512.12677"},"observation_digest":"sha256:f4c54ba6c22f2d2551135d0261d03dba388fa9800cfcb437dcca73f695c58aef","observation_id":"7ed4500e-3886-4ab4-98d1-7d5c1c067285","resolution":{"observed_at":"2026-05-25T07:25:29.063199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-03T16:38:13.326091Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.12677","last_updated":"2026-05-25T16:57:18Z","snapshot_observed_at":"2026-08-03T16:38:10.732856Z","submitted_at":"2025-12-14T13:02:06Z","title":"Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:38:13.326091Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2512.12677"},"observation_digest":"sha256:8274d8b5719477afa837cf9e7e7b243121c2ed7467d9407e5b72896513c7e078","observation_id":"d63b4287-f6aa-4180-bd21-fae2a57d8e46","resolution":{"observed_at":"2026-08-03T16:38:13.326091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-03T14:52:19.865798Z","title":"8-bit optimizers via block-wise quantization.arXiv preprint arXiv:2110.02861, (arXiv:2110.02861), June 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.18934","last_updated":"2026-06-30T23:57:23Z","snapshot_observed_at":"2026-08-06T02:17:15.385139Z","submitted_at":"2025-12-22T00:51:39Z","title":"When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:52:19.865798Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2512.18934"},"observation_digest":"sha256:3824152addaf8005664d8129b89ae79656fe2f5a2548725ca2a8492e2eab289f","observation_id":"f61e057b-ad46-4ba0-92f0-230c6f43287b","resolution":{"observed_at":"2026-08-03T14:52:19.865798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2601.11568","last_updated":"2026-04-29T11:50:41Z","snapshot_observed_at":"2026-08-05T06:39:07.257844Z","submitted_at":"2025-12-27T14:11:08Z","title":"AdaFRUGAL: Adaptive Memory-Efficient Training with Dynamic Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T19:13:30.177633Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2601.11568"},"observation_digest":"sha256:d5c1933aee88e5ef5b821014077c938129e4086c68da82e47b4ac310fe9d7270","observation_id":"6566ab8f-907b-452e-8a8d-5848c03cdb55","resolution":{"observed_at":"2026-05-16T19:18:19.272518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2601.13684","last_updated":"2026-04-18T08:34:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T07:35:06Z","title":"HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:16:31.568604Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2601.13684"},"observation_digest":"sha256:fba8438185ce71daef55af95267192c7f3185d268ea320be62092571d9119902","observation_id":"45df5dfe-cff6-47ea-8b13-d22114a12d93","resolution":{"observed_at":"2026-05-16T13:17:54.857068Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2603.26603","last_updated":"2026-05-20T17:48:34Z","snapshot_observed_at":"2026-08-08T16:50:54.146177Z","submitted_at":"2026-03-27T17:00:25Z","title":"Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T09:27:34.204972Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2603.26603"},"observation_digest":"sha256:983ad57c5c55f19b135ae28372501b750040884e5b5e48c75247a7027f9ab754","observation_id":"bcd8a09d-2f6c-48b1-9b12-d1c0a94e7295","resolution":{"observed_at":"2026-05-21T09:29:56.963343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.06836","last_updated":"2026-04-09T02:16:08Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T08:57:09Z","title":"STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:49:40.758234Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.06836"},"observation_digest":"sha256:c1a4d511bc6650e892e5db3f0bf04fc7384fffe4abe9d52b3759b4a87cc77066","observation_id":"b35a8172-04e3-4064-94fa-f70c1bbedace","resolution":{"observed_at":"2026-05-10T23:55:49.370629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:29:51.182114Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:1b3e75e9647ac9c4afe126c25832ae4a36282b9a35dfad84164290e890b56c9e","observation_id":"d071ecff-fe92-4659-b28a-fbb1d5822426","resolution":{"observed_at":"2026-05-10T05:36:02.321113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T18:01:08.514022Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:ec188416f491f0df51987c06d57496f1f9250a00f2e4bdf6227293ed28a5098b","observation_id":"6faadd91-7601-44f0-92b8-aad68f6d1ee2","resolution":{"observed_at":"2026-05-19T18:02:42.154497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.23467","last_updated":"2026-04-25T23:19:53Z","snapshot_observed_at":"2026-07-06T23:09:43.659053Z","submitted_at":"2026-04-25T23:19:53Z","title":"Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:13:51.176435Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.23467"},"observation_digest":"sha256:55596909eeb6dba78676514c269d1070109dc5b48fb3b307d3c739841a6a7252","observation_id":"2c8c744a-9be6-4545-8a47-d364c764bd8c","resolution":{"observed_at":"2026-05-11T20:41:14.307289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.24785","last_updated":"2026-08-03T13:28:35Z","snapshot_observed_at":"2026-08-06T23:31:02.471585Z","submitted_at":"2026-04-24T14:57:57Z","title":"Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T09:22:05.851456Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.24785"},"observation_digest":"sha256:068424a87c17536f172449593ba4a9f0f20b832ed8ca0d510584db3b5cd3145b","observation_id":"f4cdca61-a59f-4ba4-b976-b4889318014b","resolution":{"observed_at":"2026-05-11T20:21:12.025263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-04T05:34:06.504733Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.24785","last_updated":"2026-08-03T13:28:35Z","snapshot_observed_at":"2026-08-06T23:31:02.471585Z","submitted_at":"2026-04-24T14:57:57Z","title":"Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:34:06.504733Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.24785"},"observation_digest":"sha256:6fa49ab637a6431ce987e95f2c43b35e94af5740c5c0204126ed71dccaedbd38","observation_id":"bf3171ca-d31b-4492-843c-437b112ec8b7","resolution":{"observed_at":"2026-08-04T05:34:06.504733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.24820","last_updated":"2026-04-27T14:06:21Z","snapshot_observed_at":"2026-07-31T06:39:38.066325Z","submitted_at":"2026-04-27T14:06:21Z","title":"Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T17:56:39.124969Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.24820"},"observation_digest":"sha256:f9bdd52bfc59c0d19815faea8878e6c5a2cc4c179da40b1078bcbb13e88d2c9c","observation_id":"ae91f5d5-1d90-4616-9f9c-86e39e8b2b4f","resolution":{"observed_at":"2026-05-11T23:11:18.879146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.01870","last_updated":"2026-05-03T13:32:06Z","snapshot_observed_at":"2026-08-08T13:28:29.995118Z","submitted_at":"2026-05-03T13:32:06Z","title":"Maistros: A Greek Large Language Model Adapted Through Knowledge Distillation From Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T19:08:09.259620Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.01870"},"observation_digest":"sha256:0e9db9608976f94dfb866ab5829c356e0f40b99ccfb65a811e1c57b5a7dbdc50","observation_id":"009929a1-0701-4642-b55f-4e2b9d833f13","resolution":{"observed_at":"2026-05-09T06:00:37.376768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.05794","last_updated":"2026-05-07T07:32:27Z","snapshot_observed_at":"2026-07-30T14:24:32.368109Z","submitted_at":"2026-05-07T07:32:27Z","title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:51.611115Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.05794"},"observation_digest":"sha256:34fb01d3f48c55d7ea5609d4b7357e6f923d76176cc0be87013528cf193a87f2","observation_id":"6eccfed7-6512-4a67-81f8-5f484d422187","resolution":{"observed_at":"2026-05-11T16:41:05.506387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.17552","last_updated":"2026-05-17T17:23:23Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T17:23:23Z","title":"Q-LocalAdam: Memory-Efficient Client-Side Adaptive Optimization for Edge Federated Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T14:11:53.371521Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.17552"},"observation_digest":"sha256:de4e3462ebad5308a6f8b4f992d51f73ccafea1c425d69fe8cb0d4695d69a250","observation_id":"45819efa-d7c1-4c4e-b210-3528816a4eb4","resolution":{"observed_at":"2026-05-20T14:13:21.230707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.27737","last_updated":"2026-05-26T22:27:58Z","snapshot_observed_at":"2026-08-01T07:53:04.594255Z","submitted_at":"2026-05-26T22:27:58Z","title":"Bounded-Compute Multimodal Regression for Product-Rating Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T17:58:58.353336Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.27737"},"observation_digest":"sha256:2b4ddbb7497a909330056e7d431ff0e6d0e26723fc41ab5372c4757cbe5fc1bb","observation_id":"4fcba71d-9a04-47dc-b5a5-b08b92e64a1c","resolution":{"observed_at":"2026-06-29T18:03:48.009935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.00539","last_updated":"2026-05-30T05:11:13Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T05:11:13Z","title":"GNMR: Runtime Stability Control for Low-Precision Large Language Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T18:53:47.187437Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.00539"},"observation_digest":"sha256:80b01fd10852544165458cdb2c56ab6e631eac2af3580e6dd580a13800030412","observation_id":"7efc0b72-f121-45fc-96f7-7b3f49829d79","resolution":{"observed_at":"2026-06-28T19:42:36.064792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.02624","last_updated":"2026-05-29T12:12:08Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-05-29T12:12:08Z","title":"TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-06-28T20:01:10.638647Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.02624"},"observation_digest":"sha256:d54fe2bc3c345026732d51211c18ac657c0c578d5889c5f72702fa05309df2fb","observation_id":"73323cac-f7b3-4759-85c9-0fa8bc9595ce","resolution":{"observed_at":"2026-06-28T20:12:37.861872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.09864","last_updated":"2026-06-01T02:02:20Z","snapshot_observed_at":"2026-08-03T01:43:21.917246Z","submitted_at":"2026-06-01T02:02:20Z","title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:34.129339Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.09864"},"observation_digest":"sha256:e1de3bea2c7c8c7dc978933862b856cf5a7e42de421922d5cd5a12cda9574e46","observation_id":"33ab8464-441b-4381-a4b9-634d871b16c5","resolution":{"observed_at":"2026-07-01T22:16:16.038824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:0454bbe7d826a59ff86dce5eb5d8118b5f4d2678abf247f03109e8d169ee4801","observation_id":"85af1874-7e65-4b84-a222-377e963a6480","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.14970","last_updated":"2026-06-22T08:40:27Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T21:46:54Z","title":"Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T04:33:10.554853Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.14970"},"observation_digest":"sha256:88edb5536888d1382493f1097af1d3518209547e5e3371703c3b20064751b755","observation_id":"c95ffa89-222d-4498-8419-fc0785e05f02","resolution":{"observed_at":"2026-07-03T17:08:43.652628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-08-06T23:10:29.022464Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:0f4a7b2178e9884157256520cbb5335f2b9e079a31d5732aea92dfec2b707a70","observation_id":"a8f6dc79-f9db-49f2-b0a0-efad0d2b543e","resolution":{"observed_at":"2026-07-03T20:48:55.723997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.24447","last_updated":"2026-06-23T11:34:28Z","snapshot_observed_at":"2026-08-07T17:24:33.181681Z","submitted_at":"2026-06-23T11:34:28Z","title":"P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T00:18:07.278889Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.24447"},"observation_digest":"sha256:7978905dbc1338d1370141f941749a57a9f990f8e9b21714357edd5ecff29c86","observation_id":"1329faa3-a8a5-4a9c-8cb6-774a33d77948","resolution":{"observed_at":"2026-07-04T16:39:58.543364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:b0bbb8bf9f3599fcd06342807771621c334577bed39608d0d7cb11742182b0f8","observation_id":"c8eb76c7-31e2-4905-8db5-7b2165347bce","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-11T19:17:59.044982Z","title":"8-bit optimizers via block-wise quantization.arXiv preprint arXiv:2110.02861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04422","last_updated":"2026-07-05T17:31:36Z","snapshot_observed_at":"2026-08-09T04:20:48.760691Z","submitted_at":"2026-07-05T17:31:36Z","title":"Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:59.044982Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.04422"},"observation_digest":"sha256:49cf88f8dc45f9b97503beee3bdaa97365562975593e843a91d8786288d30bb5","observation_id":"0814f2e2-e831-447a-8c90-bd2e633f1f36","resolution":{"observed_at":"2026-07-11T19:17:59.044982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-01T14:30:35.482308Z","title":"8-bit Optimizers via Block-wise Quantiza- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18756","last_updated":"2026-07-21T06:25:46Z","snapshot_observed_at":"2026-08-06T03:18:43.212808Z","submitted_at":"2026-07-21T06:25:46Z","title":"RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:30:35.482308Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.18756"},"observation_digest":"sha256:49ab3a0919c5a2c4e5422bebefa7c9abf15dd603f6394e60c3cb04f222f35d39","observation_id":"aec9d49b-5138-48d3-979d-83f9af323cdb","resolution":{"observed_at":"2026-08-01T14:30:35.482308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-01T13:15:34.905327Z","title":"Dettmers, T., Lewis, M., Shleifer, S., and Zettlemoyer, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19181","last_updated":"2026-07-21T15:15:56Z","snapshot_observed_at":"2026-08-07T22:32:59.398321Z","submitted_at":"2026-07-21T15:15:56Z","title":"Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:15:34.905327Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.19181"},"observation_digest":"sha256:a2505f133822b1c032a534ce6cf59df0158ace5e4af13a3214108c459482c1a3","observation_id":"7dafb524-0f23-4066-8a28-05a8baa2d963","resolution":{"observed_at":"2026-08-01T13:15:34.905327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-02T08:23:07.462482Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21624","last_updated":"2026-07-07T10:18:25Z","snapshot_observed_at":"2026-08-08T06:52:26.281349Z","submitted_at":"2026-07-07T10:18:25Z","title":"FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:07.462482Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.21624"},"observation_digest":"sha256:40c576b52e01ef240edf348edf475d4878cf8d368ebc69c92238d0d8a0b1a290","observation_id":"de6d4400-f87c-4cdc-ac9f-1dfc53ca0cea","resolution":{"observed_at":"2026-08-02T08:23:07.462482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T18:20:39.185565Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03480","last_updated":"2026-08-04T11:17:54Z","snapshot_observed_at":"2026-08-09T10:45:26.851752Z","submitted_at":"2026-08-04T11:17:54Z","title":"Efficient Multilingual Neural Machine Translation via Corpus-Driven Vocabulary Pruning: An English-Arabic Case Study","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-05T18:20:39.185565Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2608.03480"},"observation_digest":"sha256:2f56a0ffd8ac23f743f599d7585bc6d7f3f675e4dec926bd11e51d132c6c3234","observation_id":"3c39e27b-609a-4a3b-8538-d8b0576acda7","resolution":{"observed_at":"2026-08-05T18:20:39.185565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2110.02861/citation-record","integrity":"/paper/2110.02861/integrity","json":"/paper/2110.02861/citation-record.json","paper":"/paper/2110.02861"},"outbound":[],"paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2110.02861."}