{"as_of":"2026-08-13T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73fb61be8ee98d4e53830d53744aa8801cc456818f0210039e663eb029e578b2","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:50:24.396837Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10663/citation-record","integrity":"/paper/2412.10663/integrity","json":"/paper/2412.10663/citation-record.json","paper":"/paper/2412.10663"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-08-12T17:50:20.963411Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-11T15:50:24.038813Z","title":"Disentangling adaptive gradient methods from learning rates","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.038813Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:1510af93af1072595634d5e6478c374a34df3e9d3ceb05c2301e985afc8e647f","observation_id":"3baabe3b-ea9d-4129-8036-9a93820a5ae4","resolution":{"observed_at":"2026-08-11T15:50:24.038813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.675585Z","title":"Qsgd: Communication-efficient sgd via gra- dient quantization and encoding","venue":null,"work_id":"5960f29b-136f-4fa8-8c0e-0f8ebf1f3ac1","year":2017},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.044650Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:667897e18d5825bab74b3ea29aacd7e2318aae80f4e15ad945ebb57d2e8443b0","observation_id":"d1f9b074-f827-40ff-a6c8-66c8a94d6cc3","resolution":{"observed_at":"2026-08-11T15:50:25.681430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-11T15:50:24.049744Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.049744Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:2ce3c6df00c2d0cf8c93a8bc6d881e8341e126b7d4821bd7fb2f73558bd03ec0","observation_id":"ef0786a3-b958-43c2-87fa-15b60fbfcef7","resolution":{"observed_at":"2026-08-11T15:50:24.049744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.655057Z","title":"Stochas- tic approximations and differential inclusions","venue":null,"work_id":"50df36cf-4648-4460-a7b6-baf525ccb7ef","year":2005},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.055011Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:482c47c0461a10dd49cec468c5606ab3666f6ab432e68b5169963bed4733d9ab","observation_id":"54b4f2df-400d-4138-a2fa-08bb085dd44d","resolution":{"observed_at":"2026-08-11T15:50:25.660354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.638018Z","title":"Conservative set valued fields, automatic differentiation, stochastic gradient methods and deep learning","venue":null,"work_id":"a6f8109c-c40a-4e16-b16b-e70a69ea306f","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.059985Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:e09c4875526a15f92b4b30d3a89f2144fefc340a2628eedb0f8cf622e33b8361","observation_id":"2f77c16d-6a36-455e-a837-ce2365108578","resolution":{"observed_at":"2026-08-11T15:50:25.643518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.611424Z","title":"Stochastic approximation: a dynamical sys- tems viewpoint","venue":null,"work_id":"1bdda253-6cf1-43ed-a270-57647128d488","year":2009},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.065354Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:748bea45765e9d9dc175f905122520a00d574f99cb2c0f2518741e5218a02864","observation_id":"5e71a2e1-7644-48ae-ac6a-f08c8ff71905","resolution":{"observed_at":"2026-08-11T15:50:25.618021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T15:50:24.070170Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.070170Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:f738744c107c1f93f8e1423e058bc9da714544c59852cdefd99f9f46f297bb8d","observation_id":"a2e85daa-e140-4eaa-afc7-71be80c143eb","resolution":{"observed_at":"2026-08-11T15:50:24.070170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.587292Z","title":"Lower bounds for finding stationary points ii: first- order methods","venue":null,"work_id":"14df92f3-9af7-4684-b55f-dcebc11fbe52","year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.075803Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:036382252d888dfb8e3a23209e1be5cd8e57905c667415f150a09af500e6cde2","observation_id":"0c3beb52-263d-4181-97d1-8e84ea942ce5","resolution":{"observed_at":"2026-08-11T15:50:25.596438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.564878Z","title":"Optimization and nonsmooth analysis","venue":null,"work_id":"8c1b535c-6e55-4f63-b593-4cfc2344a81f","year":1990},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.080337Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:19cf3a7347a8a863adb53285e638201c83347cfdda01e68c4d30e33f872935e1","observation_id":"219db309-1fd4-4e00-86d8-e886a1485330","resolution":{"observed_at":"2026-08-11T15:50:25.571868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09501","last_updated":"2019-04-11T22:39:27Z","snapshot_observed_at":"2026-08-03T21:58:34.348182Z","submitted_at":"2018-05-24T04:05:42Z","title":"AutoAugment: Learning Augmentation Policies from Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09501","snapshot_observed_at":"2026-08-11T15:50:24.085329Z","title":"Autoaugment: Learning augmentation policies from data","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.085329Z"},"links":{"cited_paper":"/paper/1805.09501","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:0642bb69b7990393c5e539dcb29ed32d1abd2f8d66bf6a3ed3be810c5a090045","observation_id":"044afc28-ef1d-4aa3-a969-8aab1f5ce6d8","resolution":{"observed_at":"2026-08-11T15:50:24.085329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.539441Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":"82e2b74e-a0a6-4d50-9c66-fff4b39c9550","year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.091242Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:2ebc7918d7bcb2c82320154e7b7d96b3864d97208bef609d984256e99f0d85cb","observation_id":"4c7b912a-605b-4cc0-9da7-d29d372c7f5b","resolution":{"observed_at":"2026-08-11T15:50:25.551165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.518996Z","title":"Pathological sub- gradient dynamics","venue":null,"work_id":"cdfc7f00-341a-456f-a107-3eee6415e1c3","year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.095983Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:7ddda14bb406224bd7e54c2041571b1d96c7d5b94815b8d33de67ee83e214e9a","observation_id":"6d53f9a6-1289-4727-bab1-ffa30862597d","resolution":{"observed_at":"2026-08-11T15:50:25.525584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.496322Z","title":"Stochastic subgradient method converges on tame functions","venue":null,"work_id":"bd9bd3ba-3209-4ee9-a48f-abefc7043f81","year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.102733Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:470a65ea44f7bf5786a5a58a256742eb2339b47dfaabfb8b71ad8eadc542e86c","observation_id":"8103e450-7622-49ed-a284-260752fa330a","resolution":{"observed_at":"2026-08-11T15:50:25.502286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.110579Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.110579Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ca45abe3fd4e9b12ec1e2234495d39faaaa523934480f611a362c92683ce1736","observation_id":"74e2a6d3-c45b-44a7-9f0a-62fc56fe814f","resolution":{"observed_at":"2026-08-11T15:50:24.110579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-08-12T09:32:12.775317Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-11T15:50:24.116174Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.116174Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:2b766c5e832824b2d906eaf8a6f9d4782d686cced499eb40432d9cc7e0d9859c","observation_id":"c3a1db67-6fec-43e1-bcb1-1f138d582f8d","resolution":{"observed_at":"2026-08-11T15:50:24.116174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.123963Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.123963Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:31ebc0a40e697636015d23a5922b8b51be29c7b33df77565392b880419cc658e","observation_id":"cb132225-4516-47d1-9830-d914a8a3fa9c","resolution":{"observed_at":"2026-08-11T15:50:24.123963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.449825Z","title":"Adaptive sub- gradient methods for online learning and stochastic opti- mization","venue":null,"work_id":"dd9f02d7-a275-41cd-bdae-58f6e8519534","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.131062Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:32607201e72c03d4886afd6281c08b8b5ef4c74f6e65437c4370774f595b39ca","observation_id":"f36936a6-d005-4d6f-8c47-47a1a693c816","resolution":{"observed_at":"2026-08-11T15:50:25.456438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.429392Z","title":"Stochastic methods for com- posite and weakly convex optimization problems","venue":null,"work_id":"f4dc096b-bef3-486d-9230-aaf2e83512cd","year":2018},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.137144Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:3f3aaf482fae83b5d6c23eba84f97bb516b14c3b494920bf001b7eeee3037d81","observation_id":"83b72dc2-c9a3-4805-a166-c81408a46899","resolution":{"observed_at":"2026-08-11T15:50:25.437387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.410497Z","title":"A survey of quan- tization methods for efficient neural network inference","venue":null,"work_id":"504c8c12-aa83-436f-9891-c523558fa995","year":2022},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.142495Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:f8289f011c29d2847b5c3c46a5bebe9a8e3e882f7143064f403f95b0247b4cde","observation_id":"83881c3b-dbff-440b-b03b-4a1640ce0314","resolution":{"observed_at":"2026-08-11T15:50:25.415832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.391325Z","title":"Practi- cal quasi-newton methods for training deep neural networks","venue":null,"work_id":"1ba54c6d-e4c9-46aa-8b23-f34f7ddf5544","year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.147386Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:e1354bf57678d21ce5e4c5877971da9244c871e460392be1469b6d1f1fc1d9d6","observation_id":"a85be752-776d-4b3b-9302-cf9ca20aa6e7","resolution":{"observed_at":"2026-08-11T15:50:25.396650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.373841Z","title":"A schur–newton method for the matrixp th root and its inverse.SIAM Journal on Matrix Analysis and Applications , 28(3):788–804, 2006","venue":null,"work_id":"db493194-06b1-43af-bf57-8da04f12585e","year":2006},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.152394Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:519e589e9d4ac47b5664ebd23aeefdae7166941f864ddc5c5d2f39305d9c7efc","observation_id":"4f6e5407-8681-490f-b325-faeedf0713f0","resolution":{"observed_at":"2026-08-11T15:50:25.378818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.356864Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"88b060b6-9637-42bc-bc8a-180b44818788","year":2018},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.157728Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:42fc6171422918638d067cebdad3403e6814b474f5c8fe2f2dd010c2f9a18976","observation_id":"6e4e80f8-2677-4a8e-9401-40c5f8321e56","resolution":{"observed_at":"2026-08-11T15:50:25.362689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.339230Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"d97675cc-3324-4600-b905-db08c4f1d63a","year":2016},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.162986Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:461237b7136fab7e1a493a26cf4d27b9be1fd3b13869b887df6c1789531176ff","observation_id":"5240ece3-6e13-42db-a26f-e792f39bf890","resolution":{"observed_at":"2026-08-11T15:50:25.345719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-11T15:50:24.168423Z","title":"Training compute-optimal large language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.168423Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ce698e89b3d5b3d3f8d8ce117410bf6ccc183e48dc11cbf0e163f373b2f815de","observation_id":"0e2e08b5-2303-43f5-aa24-323fde4246d3","resolution":{"observed_at":"2026-08-11T15:50:24.168423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T15:50:24.174002Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.174002Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:a078089907f02554d3dd7091c69a2a1086d61a5ad6199fe4f1203486acb6f4d8","observation_id":"d15b6993-2368-44b3-aed2-a014844042e7","resolution":{"observed_at":"2026-08-11T15:50:24.174002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T15:50:24.179731Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.179731Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:5d795bdee25d2628662eb7244abe8f4a1b63158d85038cb1111d1d5e1462c51b","observation_id":"284003b4-e4c2-43ec-a958-e14673caa2df","resolution":{"observed_at":"2026-08-11T15:50:24.179731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.185289Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.185289Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:4fbbdcb3a8b05f0331b0807a9a01a98856e4b826ebfa91d0ce30a20e588ee88e","observation_id":"508fc494-7374-4f12-8b47-ed211b1650cc","resolution":{"observed_at":"2026-08-11T15:50:24.185289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.190866Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.190866Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:71eec19cc0db47032c5ea6f6a4eb48000b53449f941b247b8593bb6d50e93a60","observation_id":"4abdb69c-71f3-47c5-b718-afe0724d1c5e","resolution":{"observed_at":"2026-08-11T15:50:24.190866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.196055Z","title":"Tiny imagenet visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.196055Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:85b774b009c41990af1f5e0a8646963fd7a12f5d17de58f9bef92ca2f2fd0651","observation_id":"c4002d35-b1a8-414e-9d1b-0928c4dbfaa7","resolution":{"observed_at":"2026-08-11T15:50:24.196055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.279935Z","title":"Biobert: a pre-trained biomedical language representation model for biomedical text mining","venue":null,"work_id":"f80f22ac-6b94-42c9-ae69-ec58dc345c0c","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.200658Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:85f1f19a47b8fcad0b67b15b269131a35287e1c5e0ce78e28b5695a84dd161c4","observation_id":"3e485a9b-809e-4cde-8b23-87d1fe47ac09","resolution":{"observed_at":"2026-08-11T15:50:25.284735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13492","last_updated":"2021-12-27T03:24:03Z","snapshot_observed_at":"2026-08-10T01:24:59.733860Z","submitted_at":"2021-12-27T03:24:03Z","title":"Vision Transformer for Small-Size Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13492","snapshot_observed_at":"2026-08-11T15:50:24.205713Z","title":"Vision transformer for small-size datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.205713Z"},"links":{"cited_paper":"/paper/2112.13492","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ff2ab4ced0b002551978f73448633f4e60f641fcbf7c571247588ac39d4243f0","observation_id":"6c4c0482-d15c-4101-8629-360cf7d432ea","resolution":{"observed_at":"2026-08-11T15:50:24.205713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.263102Z","title":"Memory efficient optimizers with 4-bit states","venue":null,"work_id":"3c10be3e-dc76-45ab-b454-1449552ee28e","year":2024},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.210780Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:8da744e391ddc896fe281bb98363f6d70829b3d398ed8f1c6e2072bdfb090ecc","observation_id":"71d89b49-da1a-47fb-9fe4-ca8648433408","resolution":{"observed_at":"2026-08-11T15:50:25.268482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05695","last_updated":"2023-12-10T16:21:29Z","snapshot_observed_at":"2026-08-08T00:08:18.803043Z","submitted_at":"2023-07-11T18:02:09Z","title":"ReLoRA: High-Rank Training Through Low-Rank Updates","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05695","snapshot_observed_at":"2026-08-11T15:50:24.215832Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.215832Z"},"links":{"cited_paper":"/paper/2307.05695","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:72d43b65de560ee2a904699163c3231145aa60a87780ee23095ab287e9346373","observation_id":"bd284cb7-e48f-44f4-91c2-705c9cac06ff","resolution":{"observed_at":"2026-08-11T15:50:24.215832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.246305Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"35dded08-6320-4882-8fca-6f2668f9a4d6","year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.221264Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:eafac6472cc2ccd01afafa06ea079353dc392bf2795de02ecb4ef1aa3ffbfcaa","observation_id":"1229df2f-866f-4300-8857-8c7fff14e9b3","resolution":{"observed_at":"2026-08-11T15:50:25.251290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.229989Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"1682c49f-e2ac-4cd5-ae8e-a0f4034c7a7d","year":2019},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.227137Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:c1cc1cb1f63c18980e3753c50bfc741eddedb70c2e95e679765c1a146282134a","observation_id":"d549d709-24d2-44c8-9b15-3d8a98ff84fc","resolution":{"observed_at":"2026-08-11T15:50:25.235801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.211832Z","title":"Optimizing neural net- works with kronecker-factored approximate curvature","venue":null,"work_id":"63e2995f-6df1-4141-a8e5-7875316facb8","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.232474Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:175fa194b2e94deb0279ab327d3f348e11f44da2c2a4194872053d3bcba4887a","observation_id":"530cdb4b-f617-4bc3-a572-5ddbbaa0ceb3","resolution":{"observed_at":"2026-08-11T15:50:25.217693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-12T23:35:04.444112Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-11T15:50:24.237399Z","title":"A new perspective on shampoo’s preconditioner.arXiv preprint arXiv:2406.17748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.237399Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:95e57da871440d1d6f8875ed9b21a53a8086088e45e5ce9344b4acf5bae2fb00","observation_id":"c6ddb572-8caa-4109-8cd5-b596d7cece6a","resolution":{"observed_at":"2026-08-11T15:50:24.237399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.243153Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.243153Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:db6baa568ccf557c13b071ae5b919e18925d7befcfaa19682e956e7c95952960","observation_id":"491079d2-2698-4a27-9360-c1acb16f9854","resolution":{"observed_at":"2026-08-11T15:50:24.243153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.248004Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.248004Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:0741949521304421efe801f7dab963366bb79d71dbc194026e04445464536bf4","observation_id":"8a9e99e1-4006-4404-9ccb-b7571a4def38","resolution":{"observed_at":"2026-08-11T15:50:24.248004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.165631Z","title":"Ef21: A new, simpler, theoretically better, and practically faster error feedback","venue":null,"work_id":"d939f245-55e4-433b-93a6-926a651c1543","year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.252774Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:f4e3cbda304763ccbf544429647e7a643b98004987fb1ee4ca934d0d1101dbff","observation_id":"a77dfca3-3598-4f5e-927d-6fbfa004e624","resolution":{"observed_at":"2026-08-11T15:50:25.171369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.146181Z","title":"A stochastic approxima- tion method","venue":null,"work_id":"fba225fe-2ca3-4c64-8fe6-e29678c4ff17","year":1951},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.257589Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:54f8a43f9f2b0e5623c05230ebb3f39c4e88d4dabdd94134895824086299f24b","observation_id":"82b856b9-e98d-4d56-afe7-03f7d4924448","resolution":{"observed_at":"2026-08-11T15:50:25.151379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.127895Z","title":"1-bit stochastic gradient descent and its application to data- parallel distributed training of speech dnns","venue":null,"work_id":"abbf044c-6ccc-4452-bf59-a00f33cde97b","year":2014},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.262743Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:3703ffbb778f86b55ea9bd9f8871d19113393947f877a9bc7fc6418b43a3d2bd","observation_id":"9c3e612e-aed1-405f-99e7-9ff27088862d","resolution":{"observed_at":"2026-08-11T15:50:25.134140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-05T09:31:11.684666Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-11T15:50:24.267978Z","title":"A distributed data-parallel pytorch implementation of the distributed shampoo optimizer for training neural networks at-scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.267978Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:682595f1dc51372a72f1dd0974ec805b2edcab54005d606cfe30e52160b763ac","observation_id":"4da20aa6-8ab7-4c1e-8e21-8c47e36fb61a","resolution":{"observed_at":"2026-08-11T15:50:24.267978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-12T14:19:29.389332Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T15:50:24.272997Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.272997Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:25e8de6b845a4ffae0cd67afe4d49d96273f361878dcd7d163504a385ff29f3f","observation_id":"ff676b04-675c-4a94-8bdb-b603b6613c71","resolution":{"observed_at":"2026-08-11T15:50:24.272997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.107218Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"1501fa83-4c98-4511-8309-504c5ebc6f31","year":2013},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.277637Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:eace1e2008ad42935648c29affd8bc7f7d01a094ede481f32076fce4a97d3de1","observation_id":"94ae2857-c901-4213-8b4a-5a185fbe7f38","resolution":{"observed_at":"2026-08-11T15:50:25.113071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.086023Z","title":"1-bit adam: Communication efficient large- scale training with adam’s convergence speed","venue":null,"work_id":"4520b6a4-5f99-447c-b80d-cb85ce4af31c","year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.282445Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:e11edfd7a6e26de3e8a3a95bed93eadef8443860d2950e5eb5c81d48d720a9ca","observation_id":"11f7b997-8f6e-4413-8fd2-6457c0d2fdb8","resolution":{"observed_at":"2026-08-11T15:50:25.092633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.062988Z","title":"Lecture 6.5- rmsprop: Divide the gradient by a running average of its re- cent magnitude","venue":null,"work_id":"1a17ab9d-2ba5-459b-af95-21db4633d9cb","year":2012},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.287286Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:eb9a4eb1a55a14ceab7e741a388bc69349e6d8f467b8734985123ffd85046854","observation_id":"d4ea303b-9cd2-427d-8ae7-3aa68cf20ed3","resolution":{"observed_at":"2026-08-11T15:50:25.070539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T15:50:24.293143Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.293143Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:e4a16e56af1891346da2a349ee532dd9bf91fec6e26c5b6f000f9411402534c1","observation_id":"83951d8a-9aa4-41c5-b9a4-294e56bef14b","resolution":{"observed_at":"2026-08-11T15:50:24.293143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.038688Z","title":"Powersgd: Practical low-rank gradient compression for dis- tributed optimization","venue":null,"work_id":"229a07a9-5209-4c83-98ad-6f4ea401afec","year":2019},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.298708Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:1f10911f403add3e26860db6ebb2d671a0f7f3b9fcfe5a131ec7cb92b570d52e","observation_id":"9a9287f3-272b-40e3-a161-a985cca76413","resolution":{"observed_at":"2026-08-11T15:50:25.045328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-11T15:50:24.303608Z","title":"Soap: Improving and stabilizing shampoo using adam.arXiv preprint arXiv:2409.11321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.303608Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:9ba417f43ed16e84576312e7c91cfa422f81f81db586a650c0da126c0139bd1b","observation_id":"bd7348a7-9db4-4a20-bbd2-d939d6120adf","resolution":{"observed_at":"2026-08-11T15:50:24.303608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18144","last_updated":"2025-01-10T07:22:12Z","snapshot_observed_at":"2026-08-12T23:56:11.591922Z","submitted_at":"2024-05-28T13:02:56Z","title":"4-bit Shampoo for Memory-Efficient Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18144","snapshot_observed_at":"2026-08-11T15:50:24.308787Z","title":"4-bit sham- poo for memory-efficient network training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.308787Z"},"links":{"cited_paper":"/paper/2405.18144","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:4de350fceb795f19c09d3ba05faa21540d7d600f8cef26921d75ffdfb1744f64","observation_id":"2d1e864b-319e-4c3e-a327-d32a25ef9dbe","resolution":{"observed_at":"2026-08-11T15:50:24.308787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.019515Z","title":"Terngrad: Ternary gradients to reduce communication in distributed deep learning","venue":null,"work_id":"ae4ae8ce-5f71-4edd-89d0-c3f483d76928","year":2017},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.313567Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ee8ad9ac4bc0ccafbd9bd716ad5bfd5d7dbcf8c7343bfbe8f066e6c888d1aaff","observation_id":"2c9988b1-a79c-4bd4-b47f-251750f56fd6","resolution":{"observed_at":"2026-08-11T15:50:25.025285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.00476","last_updated":"2021-10-01T15:09:22Z","snapshot_observed_at":"2026-07-06T11:53:31.073250Z","submitted_at":"2021-10-01T15:09:22Z","title":"ResNet strikes back: An improved training procedure in timm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.00476","snapshot_observed_at":"2026-08-11T15:50:24.318482Z","title":"Resnet strikes back: An improved training procedure in timm.arXiv preprint arXiv:2110.00476, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.318482Z"},"links":{"cited_paper":"/paper/2110.00476","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:a27a128576117c53758569ece2d0b518ad6f79450f5b2e82e1646fb4712c9236","observation_id":"0d779a2b-6e52-42c8-98de-36510fe533fe","resolution":{"observed_at":"2026-08-11T15:50:24.318482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-11T15:50:24.323992Z","title":"Bloomberggpt: A large lan- guage model for finance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.323992Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:5505cdb59aa876cd4f9521f0a08207d9f199f6dcbf244e9dc3069686f6612743","observation_id":"837dac85-0c35-4d77-8720-c24c9d328772","resolution":{"observed_at":"2026-08-11T15:50:24.323992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:25.002147Z","title":"Crystal graph convolu- tional neural networks for an accurate and interpretable pre- diction of material properties","venue":null,"work_id":"d036d48e-6a7d-47e3-9971-59de4bddf766","year":2018},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.330016Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:b2dc92f171de567ca82e2e22590ab64569ec4d2a769491603e8ae55b856355dc","observation_id":"9f2669cf-3312-4c83-8134-f4730221d530","resolution":{"observed_at":"2026-08-11T15:50:25.007259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04480","last_updated":"2024-11-29T08:38:55Z","snapshot_observed_at":"2026-08-12T23:28:12.082708Z","submitted_at":"2024-07-05T13:01:36Z","title":"LoCo: Low-Bit Communication Adaptor for Large-scale Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04480","snapshot_observed_at":"2026-08-11T15:50:24.335113Z","title":"Loco: Low-bit communication adaptor for large-scale model training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.335113Z"},"links":{"cited_paper":"/paper/2407.04480","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:c13d90dd567b20ea3265c643cc175a6826e0ce97c21ba9bfb40f67ab4edf402a","observation_id":"b532440f-c87c-43b1-9ed8-218200bdd7f0","resolution":{"observed_at":"2026-08-11T15:50:24.335113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.985193Z","title":"Adan: Adaptive nesterov momentum algo- rithm for faster optimizing deep models","venue":null,"work_id":"24e18db0-c2ff-4c80-b076-eba6c9befe18","year":2024},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.341648Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ebc9da899db491baa6c11532700d7560bbbe97d4f795c81a1f1ebfed8ef0e8d4","observation_id":"0514f0bb-b1c6-4db2-a352-774fcb21dfc7","resolution":{"observed_at":"2026-08-11T15:50:24.990483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.347114Z","title":"Zeroquant: Ef- ficient and affordable post-training quantization for large- scale transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.347114Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ca9df71892a942171ea2b86f6ddb31969006577b8b8372d1eca09c5583fc1a0c","observation_id":"6c659bcd-1664-45b7-a297-0384a93ec693","resolution":{"observed_at":"2026-08-11T15:50:24.347114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.955028Z","title":"A general regret bound of preconditioned gradient method for dnn training","venue":null,"work_id":"19cc2ac6-e026-4c90-bd7a-68f738916d0f","year":2023},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.352290Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:4fa7578aff8a3e7e80623b278740420ee6ab259cd27eed443e5fd5645cf0e5ec","observation_id":"e45e018e-1712-48c0-b86c-642f11f8746d","resolution":{"observed_at":"2026-08-11T15:50:24.960505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.938194Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":"32cfc855-666e-4c8b-998b-2c2c289689c5","year":2019},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.358057Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:385116fc605da984b327106ca18a69b7d0b65311bcd58a7d511c498b77fa7746","observation_id":"103ed47c-d57b-4d5c-a7ec-531d6af374ad","resolution":{"observed_at":"2026-08-11T15:50:24.943136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.919971Z","title":"mixup: Beyond empirical risk minimiza- tion","venue":null,"work_id":"e44e5d50-deca-410a-af60-9d64b4d1aa71","year":2018},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.363316Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:ce72ba86c92b43d08a83ae2514fc421b2b33e6e05d462a6a50eff09fada41a7a","observation_id":"167cede4-e469-48ae-89f0-4b21c3efc5be","resolution":{"observed_at":"2026-08-11T15:50:24.926154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.902901Z","title":"Why are adaptive methods good for attention mod- els? Advances in Neural Information Processing Systems , 33:15383–15393, 2020","venue":null,"work_id":"6aa3cf4f-48f7-4bd4-b41c-4b4c1ea729e6","year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.368363Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:afe8b1f1deb1319bf302203d6782eaf6bde243b6d2e53012add34f4844576f95","observation_id":"f5e70d96-6696-41f9-abb7-21b535705d11","resolution":{"observed_at":"2026-08-11T15:50:24.908110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-11T15:50:24.373990Z","title":"Galore: Memory- efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.373990Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:e08631ddb7ff055ef4550d3a9298a9599194ff99dc0059c07963289d90fc96cf","observation_id":"9948481d-ec79-41c1-98c9-912879ad5dea","resolution":{"observed_at":"2026-08-11T15:50:24.373990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.884320Z","title":"Random erasing data augmentation","venue":null,"work_id":"dd2a964d-e5d0-47f9-a7a7-5c27e9d43b76","year":2020},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.379527Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:f5db586f6cd6e8a9680bccaa57d5653613cbbcf0b934694290d3fa968b01cbd1","observation_id":"3f7081ec-f753-40ea-8b75-b1bdf44ee7bb","resolution":{"observed_at":"2026-08-11T15:50:24.890889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.865623Z","title":"Definition B.2","venue":null,"work_id":"cadd0790-54e7-4aac-8432-2b25d0a85532","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.385998Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:4645869754d0801350c5d5e6e623a92036c9bf5518b663885824e8760ef9a8b9","observation_id":"e543c5ac-48f1-47ae-ba25-6244b883ca8a","resolution":{"observed_at":"2026-08-11T15:50:24.871998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.848543Z","title":null,"venue":null,"work_id":"930a5bbe-12e7-4063-820d-cfe665715dd7","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.391447Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:9783c73f1fa77455828f7064c233e521827a40a926412fb6d1c05fd057e49537","observation_id":"2c018be2-19f1-4e67-9b6c-2a4afb0248bc","resolution":{"observed_at":"2026-08-11T15:50:24.853790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:50:24.827263Z","title":"Here NMi is the normal space of Mi","venue":null,"work_id":"3c1ec0b3-9961-44a3-b2c7-4dd94af2a054","year":null},"citing_paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:24.396837Z"},"links":{"citing_paper":"/paper/2412.10663"},"observation_digest":"sha256:cda482585043efc2e4545f1e131417f6a138c2cf8e4f2846a13b0d74ab370c86","observation_id":"cacbd0aa-ca71-4ff6-9f9e-6952fac1849c","resolution":{"observed_at":"2026-08-11T15:50:24.834907Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10663","last_updated":"2025-03-12T09:19:31Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T19:52:59.338867Z","submitted_at":"2024-12-14T03:32:54Z","title":"Memory-Efficient 4-bit Preconditioned Stochastic Optimization"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2412.10663."}